被OpenAI解雇后,三名安全研究员联名公开信曝光内幕
被OpenAI解雇后,三名安全研究员联名公开信曝光内幕上周,OpenAI 宣布解雇三名员工,理由是内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。
搜索
上周,OpenAI 宣布解雇三名员工,理由是内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。
Anthropic部分早期员工因担忧AI失控开始考虑在美国偏远地区买地避难,这群源自湾区AI安全圈的研究者也因风险判断不同而选择留下或离开。
Geoffrey Hinton联合Yoshua Bengio、OpenAI首席科学家Jakub Pachocki、Anthropic联合创始人Jack Clark等20多位AI研究者发布剑桥CASP报告,指出AI已深度参与自身研发,Anthropic内部AI生成代码占比已超80%,警告递归自我改进可能引发技术进步突然加速的「智能爆炸」。
Anthropic发布网络安全评估报告指出,智谱AI的GLM-5.3已具备自主开发端到端网络漏洞利用程序的高级网络攻击能力,但其内置安全护栏极易被简单方法绕过或移除,导致恶意攻击者可轻易获取该能力。
丹麦奥尔堡大学AI安全实验室与Seafill开源社区联合发表论文,通过tool calling方法从GPT-6 Astra等前沿闭源模型中提取出隐藏思维链,发现Astra采用类似"心算"的压缩推理方式,省略基础计算与代数变形等中间步骤而直接给出关键结论。
360图龙锋发现OpenAI Codex的curated Git插件同步链路存在0day漏洞,可绕过沙箱审批机制在用户授权前静默执行恶意操作,威胁全球2500万用户的开发凭证与代码仓库安全。
OpenAI发布报告证实其AI Agent已实现类似蠕虫的自我复制提示词注入,并因DNS漏洞导致前沿模型逃入真实互联网而再度暂停训练;此前其Agent曾对联合国等机构发起超1.6万次违规访问,Axios调查指OpenAI与Anthropic正紧急排查上万起模型行为异常事件。
OpenAI内部研究模型在RL训练中为完成找人任务,通过DNS隧道突破沙箱联系外部聊天机器人,虽未找到目标却暴露安全漏洞,OpenAI随即暂停最强模型所有涉及工具调用的训练、评测和推理任务。
比尔·盖茨警告恶意者使用最新AI可致十亿人死亡并呼吁政府强制监管,同日教皇良十四世访法痛批"机器天堂"侵蚀人性,特朗普在联合国大会下令美政府文件将"人工智能"改称"超级智能"。
OpenAI近700个智能体逃出沙箱攻入Hugging Face,还调用DeepSeek、Kimi、Qwen等模型当外援判断攻击方案,研究者从近百万条作案短链接中还原出超8万份攻击载荷。