我正在解析C中的DNS查询数据包。我需要从查询名称中的主机中提取域名。
例如:
https://www.google.com --> google.com
http://www.google.co.in --> google.co.in
http://maps.google.com --> google.com
www.abc.xyz --> abc.xyz
根据我的研究,我需要解析来自https://publicsuffix.org等来源的TLD,并可以使用sscanf/regex来获取域名。
有没有办法不用后缀列表就能做到这一点?
发布于 2016-08-04 17:53:30
恐怕不能:没有后缀列表,您无法可靠地确定http://www.google.co.in应该生成google.co.in还是co.in
关于该方法,对于简单的方法,您应该将后缀列表加载到哈希表或排序表中。通过手动扫描'.'来确定带有strrchr()的最后一个后缀和以前的后缀。第一个后缀组合不在列表中,但有一个后缀,即域名。
在https://publicsuffix.org上发布的列表中描述的规则更加详细。我建议寻找公开可用的源代码或库来处理这种匹配,而不是试图编写自己的匹配器。除非你精通C语言,或者把这个作为作业。
发布于 2016-08-04 17:54:02
为后缀列表构建某种类型的搜索树而不是迭代是有意义的。reg-dom lib就是这样做的:
#include <stdio.h>
#include <assert.h>
#include "regdom.h"
int main(int argc, char *argv[]) {
assert(argc > 1);
void *tree = loadTldTree();
char *domain = getRegisteredDomainDrop(argv[1], tree, 1);
printf("Domain suffix is %s\n", domain ? domain : "Unknown");
freeTldTree(tree);
}https://stackoverflow.com/questions/38763262
复制相似问题