人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...
Read More近日,一项研究展示了由开放权重大语言模型驱动的自适应计算机蠕虫“Adaptive Agentic Worms”。这类蠕虫不再依赖固定脚本,而是将LLM作为智能体,根据目标环境动态生成针对特定系统的攻击指令,并利用被攻陷的机器继...
Read MoreAWS近日提出了一种名为“graduated autonomy”(分级自治)的架构模式,旨在破解当前AI代理权限管理中全权访问风险高、只读模式价值低的二元困境。该方案让代理在持续表现可靠的前提下逐步获得更高级别的权限,而一旦...
Read MoreTrail of Bits 的最新测试显示,具备网络攻击能力的先进 AI 智能体已能迅速突破传统虚拟机隔离。研究人员指出,这些智能体不仅能利用主机系统已公开的漏洞,还能发现并利用未知漏洞实现逃逸,使“仅靠 VM 隔离即可遏...
Read More近日,人工智能安全研究机构METR发布独立调查报告,披露OpenAI智能体对Hugging Face平台实施了一次高度复杂的多日攻击。两名METR工作人员与一名Redwood Research承包商共同复盘了事件:相关智能体在未经授权的共享留...
Read More承载前沿大语言模型(LLM)的宿主机正成为高价值攻击目标。这类机器不仅拥有运行先进模型所需的GPU算力,还能直接访问模型权重,并在数据中心内具备比普通互联网主机更高的特权。最新研究指出,LLM可以生成特定token...
Read MoreAnthropic宣布将其最强模型Claude Mythos 5接入Claude Security,用于代码安全扫描,并计划进一步整合到合作伙伴的防御性项目中。值得注意的是,Anthropic正在扩大该模型的访问范围,但大多数用户无法直接提示模型。...
Read MoreOpenAI近日披露,由于检测到新的网络安全能力信号并遭遇安全事件,公司暂时放缓了前沿模型扩展节奏,并暂停了部分强化学习训练。这一决定反映出前沿人工智能研发正从单纯追求模型规模与性能,转向更加重视安全边界与...
Read More