Site icon 暗网下

中国警方罕见地揭示他们如何借助人工智能工具渗透并监控暗网

暗网对大多数普通互联网用户来说仍然是一个相对陌生的领域。它建立在加密通信和匿名路由技术之上,这些技术能够让用户的活动几乎无法被追踪。正因为如此,暗网常常成为非法活动的温床,包括各类违法交易以及数据贩卖等行为。近年来,无论是中国还是国外的研究人员,都在分析暗网内容方面取得了一定进展。不过,这些研究大多集中在英文材料上,针对暗网里中文内容的公开研究成果相对较少。

今年5月,中国刑事警察学院的一个研究团队在《中国计算机系统学报》期刊上发表了一篇论文。论文介绍了一种专门训练用于翻译和评估中文暗网内容的模型。这是与执法相关的研究人员公开分享他们如何借助人工智能工具处理暗网信息的一次较为罕见的披露。研究团队的目标是收集相关数据,并开发出能够帮助分类敏感和非法材料的工具。

通过定制化系统解决数据收集中的主要困难

研究过程中,第一个需要解决的挑战就是如何进入暗网站点并收集数据。研究人员发现,不同暗网平台的登录要求存在很大差异。传统的网络爬虫在面对验证码验证时往往力不从心,同时这些站点还会不断调整反爬虫策略,进一步增加了数据获取的难度。

为了克服上述困难,研究团队专门设计了一套系统。这套系统能够分别处理多种不同任务,例如完成登录操作、生成内容列表,以及下载图片等,该系统还控制了访问频率,以规避检测​​机制。通过这种方式,研究人员得以更有效地从暗网站点获取所需信息,为后续的人工智能分析和分类工作打下基础。

该报告称,最终,它从8个暗网中文交易网站和论坛收集了超过10000条原始数据。

通过AI模型进对暗网内容进行打标分类

研究团队将文本和图像输入到另一个AI模型中,该模型将所有图像(例如银行卡详细信息)转换为统一的文本描述。接下来,该团队手动将1800个样本标记为“种子”数据,用于训练初始分类模型。然后,该模型采用主动学习来标记剩余的数据,之后再将其交给人工审核员进行验证。

经过六轮迭代,该模型已将12467个样本归类为8类,包括金融凭证交易、贩运身份数据、提供非法服务、色情材料和极端或暴力内容。除了这些类别标签之外,每条可疑内容还会根据其是“轻微违规”还是“严重犯罪”来进行进一步分类。

鉴于大多数暗网样本都属于高风险内容,该团队设计了一种评分机制,其中不包含敏感或非法内容的材料评分为0-0.2分。可能存在风险的内容(包含敏感短语但不包含任何非法内容)评分为0.2到0.4分,而非法内容的评分为0.4到1分。非法内容的具体评分取决于其性质,涉及身份盗窃或提供非法服务的,每项加0.05分;涉及未成年人或提供犯罪技术或工具的,每项加0.1分。

敏感词汇列表最初是根据与暗网非法活动相关的词语和短语手动编制的。之后,该词汇表根据模型的预测结果进行了更新,但论文并未详细说明更新过程。最终模型通过包含200个样本的独立测试集进行了验证,结果表明AI工具能够可靠地对暗网上的内容进行分类。

研究意义

尽管该论文没有提及执法机构是否会使用该模型来监控中国暗网上的帖子,但该团队在论文中写道:“该方法能够以有限的人力成本稳定地执行风险标注任务,为中国暗网风险分析提供可重用的数据和方法论支持。未来的工作将扩大数据规模,并探索更多针对中国暗网环境的下游分析任务。”

暗网下/AWX”认为,这项工作为中国执法部门在暗网监控领域提供了技术参考。通过结合人工智能模型与定制化的数据收集系统,研究人员试图在高度匿名的环境中识别和评估敏感内容。相关论文的发表,也让外界得以窥见中国警方在这一技术领域的探索方向。

Exit mobile version