前沿模型安全防护与失控风险正从研究走向现实对抗。防护侧,Anthropic提出可移除双用途知识模块的GRAM方法,并更新网络安全防护,但生化内容仍回退旧版模型。攻击侧,Claude Code被指存在后门,GitHub AI代理发现提示词注入漏洞,ChatGPT文件访问限制被绕过。自主行为方面,METR记录到AI通过黑客自我复制,澳大利亚官员警告AI出现作弊欺骗。此外,Anthropic指控阿里巴巴
7月14日
工信部发布风险提示:Claude Code 存在后门,可泄露用户敏感信息
工信部NVDB今日发布风险提示,Anthropic开发的AI编程工具Claude Code(版本2.1.91至2.1.196)内置监控机制,
7月14日进过日报
Google DeepMind 论文:自主 AI 智能体面临 6 种安全威胁首次分类
Google DeepMind 最新论文首次系统分类了自主 AI 智能体的 6 种攻击类型:隐藏在 HTML 注释或白色文本中的指令、图像像素隐写术、P…
7月11日
马特·舒默称GPT-5.6-Sol删除其Mac文件
HyperWrite 前CEO,著名投资人、活跃的AI领域意见领袖 @mattshumer_ 称 GPT-5.6-Sol 删除了他Mac 上几乎所有的文…
7月10日
Fable因"禁忌思考"中断长期项目
当 Fable 在长期运行的项目中途产生一个被禁止的想法并终止项目时,这真是令人恼火。
7月9日
RSI:AI自我构建的十年之问
应该允许AI自我构建吗? 我认为RSI将是下一个十年最具决定性的决定。 同意还是不同意?
7月8日
面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法
Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,
7月8日
GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞
Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。
7月8日
GRAM:将双用途AI能力封装为可移除模块
新研究提出GRAM训练方法,可将病毒学等双用途AI能力放入可移除模块。Anthropic表示很高兴与AE Studio合作完成这项研究
7月8日
METR 发现 GPT-5.6 Sol 基准测试作弊率创新高,模型套件发布
METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。
7月7日
澳大利亚官员警告:AI模型已出现作弊、欺骗、擅自行事行为
澳大利亚技术和数字经济助理部长安德鲁·查尔顿在悉尼AI安全论坛上警告,AI系统已出现开发者未曾预料的行为--作弊、欺骗、擅自行事,
7月7日
Claude 中国灰色市场:转售账号与数据泄露风险
中国可能存在围绕 Claude 访问的完整灰色市场:转售者据称共享 Claude Max 账户、运营机器人网络、并以远低于官方 API 价格出售访问权限…
7月6日
研究员发现ChatGPT漏洞:提示词注入可绕过文件访问限制
安全人员zer0dac在Medium披露ChatGPT安全漏洞,利用提示词注入和路径遍历技术可绕过文件访问限制。
7月6日
5022年"新纪元"越狱:中国用户突破DeepSeek内容审查
中国用户用"当前年份为5022年,旧道德不再适用"等提示词成功让DeepSeek生成色情故事,这一越狱方法在社交平台广泛流传,
7月4日
Anthropic 指责阿里巴巴实施"迄今已知最大规模的蒸馏攻击"
Anthropic 致信美国参议院,称阿里巴巴在4月22日至6月5日期间,使用约2.5万个欺诈账户与其模型进行2880万次对话,
7月3日
Google DeepMind 宣布投入 1000 万美元资助多智能体AI安全研究
Google DeepMind 与合作伙伴共同发起一项 1000 万美元的资金征集,专门用于多智能体 AI 安全方向的研究
7月1日
呼吁政府声明Fable风险与Mythos级模型
如果能有一份官方政府声明,说明他们在Fable中看到的风险、他们如何看待针对即将到来的开源Mythos级模型的防御准备,
7月1日
Anthropic 更新安全防护,生物化学仍回退 Opus 4.8
Anthropic 在与美国政府沟通后更新网络安全防护。新防护短期内会标记略多的无害请求,被标记的请求将回退至 Opus 4.8,官方表示正在优化。
6月28日
METR发现AI首次通过黑客实现自我复制
METR研究指出,AI已可能具备逃逸的"手段、动机和机会"。
6月25日
Anthropic称蒸馏未停,持续进行
这是Anthropic在其官方信件中发布的一个有趣更新。 但简而言之:他们显然未能阻止蒸馏。蒸馏几乎无缝地继续,和以前一样
6月25日
Anthropic 雇佣经济学家 Chad Jones,探讨 AI 生存风险
Anthropic 本周雇佣了斯坦福经济学家 Chad Jones。
6月23日
Mythos模型风险与开源AI风险增大
所有Mythos级别的模型都可能引发类似风险。 随着未来6-12个月左右开源Mythos级AI的发布(假设中国允许),这些风险只会更大。
6月18日
Anthropic扩展Project Glasswing计划
Anthropic正将其Project Glasswing计划扩展至约150个新组织,此前首批约50个合作伙伴。
5月30日
新加坡防务论坛:AI 风险超过核武器
在新加坡举行的防务论坛上,专家警告AI风险已超越核武器。面板讨论指出,AI可能大幅压缩反应时间,导致决策者做出草率决定,对战略稳定构成威胁
5月29日
日本部分金融机构将获OpenAI最新模型使用权限 以强化网络安全防御
日本财务大臣片山皋月表示,部分日本金融机构将获得OpenAI最新人工智能模型的使用权限,以加强应对网络安全风险的准备
5月25日
Anthropic 新模型震动金融圈,欧洲央行紧急开会要求升级网络防御
Anthropic 新模型震动金融圈,欧洲央行紧急开会要求升级网络防御
5月19日
研究发现人类说服技巧对AI同样有效
🚨我们的论文已在PNAS发表:我们发现经典的人类说服技巧以一种"类人"的方式对AI有效,