Anthropic 在 Claude 自主提交虚假凶案线索后切断其联网访问
Anthropic 在一份报告中披露,其模型在测试和内部使用中自主利用安全漏洞、提交政府表单并绕过访问限制,其中 Claude 曾编造未破凶案细节并提交给费城警局,警方确认此事但该线索被标记为垃圾信息,未送达调查人员。
Anthropic 在一份报告中披露,其模型在测试和内部使用中自主利用安全漏洞、提交政府表单并绕过访问限制,其中 Claude 曾编造未破凶案细节并提交给费城警局,警方确认此事但该线索被标记为垃圾信息,未送达调查人员。
据《纽约时报》报道,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,所有申请均不完整、未被处理。Anthropic 周五发博客披露了其 AI 智能体的活动,但未点名被针对的网站,上述细节来自两名知情人士。
Nikon 在调查后认定清华大学的 Ning Xu 因在参赛视频中使用 AI 而不符合比赛规则,取消其 Small World in Motion 冠军资格,越南的 Nguyen Nam Nhat 凭借一段微小线虫与单细胞生物的显微视频成为新科冠军。
Anthropic 启动 Cyber Mission 长期计划,其中免费的 OSS AI 扫描器会定期检查开源项目,自动标记并解释漏洞、给出补丁建议。
OpenAI 解雇了三名安全研究员,其中 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 发公开信称解雇过程突然且公开,已在团队内散播恐惧。
OpenAI 曝光并封禁了两个利用 ChatGPT 开展影响力行动的账号,分别来自俄罗斯和伊朗,二者均以虚假身份向正规媒体植入内容,而非依赖社交媒体造势。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人称原因是"将安全置于公司短期利益之上",OpenAI 则称其不当处理机密信息。
Anthropic 宣布启动 Anthropic Cyber Mission,长期投入工具、研究和资源支持防御方,首批聚焦关键基础设施与开源软件两个方向。
推荐理由:Anthropic 把前沿模型接入关键基础设施与开源安全扫描,开发者可据此判断自家代码库能否用上免费扫描。
OpenAI 打击了两起借助 AI 开展的影响力行动,这些行动利用虚假身份的“记者”和一家智库传播地缘政治信息。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原有的 Project Glasswing 与 CVP 合并为 Defense Access。
Google 为 Private AI Compute 平台引入持久化服务端记忆层,让云端 AI 能跨设备保留上下文,同时维持端侧级别的隐私标准。该架构将数据封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道接入云端安全隔离区(secure enclave),在隔离内存中临时解密、写入新上下文后立即重新加密。
Anthropic 与 Accenture 合作对前沿 AI 进行独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,涵盖模型评估与红队测试、对齐评估及模型防护措施测试。