工作中经常遇到一类需求,根据 IP 地址段来查找 IP 对应的归属地信息。如果把查询过程放到关系型数据库中,会带来很大的 io 消耗,速度也不能满足,显然是不合适的。 那有哪些更好的办法呢?为此做了一些尝试
工作中经常遇到一类需求,根据 IP 地址段来查找 IP 对应的归属地信息。如果把查询过程放到关系型数据库中,会带来很大的 io 消耗,速度也不能满足,显然是不合适的。
那有哪些更好的办法呢?为此做了一些尝试,下面来详细说明。
构建索引文件
在 GitHub 上看到一个ip2region 项目,作者通过生成一个包含有二级索引的文件来实现快速查询,查询速度足够快,毫秒级别。但如果想更新地址段或归属地信息,每次都要重新生成文件,并不是很方便。
不过还是推荐大家看看这个项目,其中建索引的思想还是很值得学习的。作者的开源项目中只有查询的相关代码,并没有生成索引文件的代码,我依照原理图写了一段生成索引文件的代码,如下:
# -*- coding:utf-8 -*-
import time
import Socket
import struct
IP_REGION_FILE = './data/ip_to_region.db'
SUPER_BLOCK_LENGTH = 8
INDEX_BLOCK_LENGTH = 12
HEADER_INDEX_LENGTH = 8192
def generate_db_file():
pointer = SUPER_BLOCK_LENGTH + HEADER_INDEX_LENGTH
region, index = '', ''
# 文件格式
# 1.0.0.0|1.0.0.255|澳大利亚|0|0|0|0
# 1.0.1.0|1.0.3.255|中国|0|福建省|福州市|电信
with open('./ip.merge.txt', 'r') as f:
for line in f.readlines():
item = line.strip().split('|')
print item[0], item[1], item[2], item[3], item[4], item[5], item[6]
start_ip = struct.pack('I', struct.unpack('!L', socket.inet_aton(item[0]))[0])
end_ip = struct.pack('I', struct.unpack('!L', socket.inet_aton(item[1]))[0])
region_item = '|'.join([item[2], item[3], item[4], item[5], item[6]])
region += region_item
ptr = struct.pack('I', int(bin(len(region_item))[2:].zfill(8) + bin(pointer)[2:].zfill(24), 2))
index += start_ip + end_ip + ptr
pointer += len(region_item)
index_start_ptr = pointer
index_end_ptr = pointer + len(index) - 12
super_block = struct.pack('I', index_start_ptr) + struct.pack('I', index_end_ptr)
n = 0
header_index = ''
for index_block in range(pointer, index_end_ptr, 8184):
header_index_block_ip = index[n * 8184:n * 8184 + 4]
header_index_block_ptr = index_block
header_index += header_index_block_ip + struct.pack('I', header_index_block_ptr)
n += 1
header_index += index[len(index) - 12: len(index) - 8] + struct.pack('I', index_end_ptr)
with open(IP_REGION_FILE, 'wb') as f:
f.write(super_block)
f.write(header_index)
f.seek(SUPER_BLOCK_LENGTH + HEADER_INDEX_LENGTH, 0)
f.write(region)
f.write(index)
if __name__ == '__main__':
start_time = time.time()
generate_db_file()
print 'cost time: ', time.time() - start_time
--结束END--
本文标题: 使用Redis有序集合实现IP归属地查询详解
本文链接: https://www.lsjlt.com/news/51738.html(转载时请注明来源链接)
有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341
下载Word文档到电脑,方便收藏和打印~
2024-05-07
2024-05-07
2024-05-07
2024-05-07
2024-05-03
2024-05-03
2024-05-03
2024-05-03
2024-05-03
2024-05-03
回答
回答
回答
回答
回答
回答
回答
回答
回答
回答
0