近期,美國人工智能公司 Anthropic 發布一份報告,揭露多起使用者「濫用」(misuse)其大型語言模型 Claude 的案例,包含用 AI 監控異議人士、撰寫「維穩」報告,以及交友軟體詐騙。這些案例的幕後黑手,既包含網路間諜、營利型網路犯罪者,也包含國安機關中的小螺絲釘,以及疑似由威權國家支持的團體。
這並非 Anthropic 首次發布類似報告。2025年3月、8月、11月,Anthropic 都曾發布這份全名為「偵測並遏止 AI 濫用」的報告(以下簡稱「濫用報告」)。但相較於過往,今年9月的最新報告格外詳盡:全文長達154頁,將濫用行為分爲七大類:網路作戰、監控、影響力行動、傳統武器開發、生物研究、詐騙,以及非法蒸餾。每類底下,都收錄數個以「GTC」(generative threat groups,生成式 AI 威脅團體)為編碼的案例。
這份報告的珍貴之處在於,它不僅披露多起濫用行動的細節、梳理濫用行為背後的趨勢,也公開一部分去識別化後的原始資料,讓我們得以一窺 AI 已如何嵌入間諜、監控與網路犯罪的日常運作。
然而,報告背後明顯的利益衝突也值得注意。一方面,濫用事件的資料完全掌握在 Anthropic 手中,外界難以獨立核實,其調查過程與揭露標準也缺乏透明度;另一方面,Anthropic 指控的部分對象,正是與其存在直接商業競爭關係的中國 AI 公司。考慮到 Anthropic 正值 IPO 前夕,這份報告也應作為一份商業文件來分析。