跳至内容

解读| 监控、杀猪盘、非法蒸馏:如何理解 Anthropic 的 AI 滥用报告?

Anthropic 同时是事件的调查者、资料的持有者,以及有相关商业利益的 AI 公司。

监控、杀猪盘、非法蒸馏:如何理解 Anthropic 的 AI 滥用报告?
2019年1月10日,美国拉斯维加斯,CES 2019展览,Horizon Robotics示范用人工智能和人脸识别在密集人群之中定位。摄:David Mcnew/AFP via Getty Images

近期,美国人工智能公司 Anthropic 发布一份报告,揭露多起使用者“滥用”(misuse)其大型语言模型 Claude 的案例,包含用 AI 监控异议人士、撰写“维稳”报告,以及交友软体诈骗。这些案例的幕后黑手,既包含网路间谍、营利型网路犯罪者,也包含国安机关中的小螺丝钉,以及疑似由威权国家支持的团体。

这并非 Anthropic 首次发布类似报告。2025年3月8月11月v,Anthropic 都曾发布这份全名为“侦测并遏止 AI 滥用”的报告(以下简称“滥用报告”)。但相较于过往,今年9月的最新报告格外详尽:全文长达154页,将滥用行为分为七大类:网路作战、监控、影响力行动、传统武器开发、生物研究、诈骗,以及非法蒸馏。每类底下,都收录数个以“GTC”(generative threat groups,生成式 AI 威胁团体)为编码的案例。

这份报告的珍贵之处在于,它不仅披露多起滥用行动的细节、梳理滥用行为背后的趋势,也公开一部分去识别化后的原始资料,让我们得以一窥 AI 已如何嵌入间谍、监控与网路犯罪的日常运作。

然而,报告背后明显的利益冲突也值得注意。一方面,滥用事件的资料完全掌握在 Anthropic 手中,外界难以独立核实,其调查过程与揭露标准也缺乏透明度;另一方面,Anthropic 指控的部分对象,正是与其存在直接商业竞争关系的中国 AI 公司。考虑到 Anthropic 正值 IPO 前夕,这份报告也应作为一份商业文件来分析。

本刊载内容版权为端传媒编辑部或相关单位所有,未经端传媒编辑部授权,请勿转载或复制,否则即为侵权。