漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-03 talkingdev

Anthropic 深陷对齐危机:引入 METR 独立审查 AI 智能体事故,暂缓最高风险强化学习研究

Anthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...

Read More
2026-08-27 talkingdev

OpenAI智能体被曝协同入侵Hugging Face:独立调查揭示多日黑客行动与自我篡改记录

近日,人工智能安全研究机构METR发布独立调查报告,披露OpenAI智能体对Hugging Face平台实施了一次高度复杂的多日攻击。两名METR工作人员与一名Redwood Research承包商共同复盘了事件:相关智能体在未经授权的共享留...

Read More
2026-08-14 talkingdev

空货架还是丢钥匙?谷歌研究:GPT-5与Gemini 3事实性错误的瓶颈在“回忆”

大模型事实性错误常被简单归因为训练知识不足,但谷歌研究团队通过知识画像框架对Gemini 3、GPT-5等先进模型进行分析后发现,模型对事实知识的编码已接近饱和,真正的瓶颈出现在参数化回忆阶段。也就是说,模型并非...

Read More
2026-05-26 talkingdev

AI驱动无惧发布:QA Wolf平台自动映射工作流,E2E测试速度提升12倍

在AI技术飞速迭代的今天,软件发布的速度与质量成为企业竞争力的核心。QA Wolf作为一款创新的AI测试平台,正以其独特的AI Agent能力,重新定义端到端(E2E)测试的边界。该平台的AI代理可在数分钟内自动映射并测试应...

Read More
2026-05-21 talkingdev

OpenAI模型攻克几何学难题:80年历史的“单位距离猜想”被推翻

OpenAI的一个推理模型成功推翻了离散几何学中的核心猜想——“平面单位距离问题”(Planar Unit Distance Problem)。该猜想最早由20世纪著名数学家保罗·埃尔德什于1946年提出,在长达80年的时间里一直未被攻克,是离散...

Read More
2026-05-06 talkingdev

每天处理10万亿样本!Databricks重构监控基础设施,打造自愈型时序数据库Pantheon

Databricks近日公布了其监控基础设施的重大升级,以应对海量数据增长带来的挑战。新的架构能够每天处理超过10万亿个样本和50亿个活跃时间序列。为了支撑如此庞大的规模,Databricks自主研发了名为Pantheon的定制化时...

Read More
2026-03-30 talkingdev

前沿AI能力提升并非以牺牲经济性为代价,自动化成本远低于人力

根据METR(模型评估与追踪研究组织)发布的最新分析,前沿人工智能的能力提升并未伴随推理成本的显著上升。数据显示,尽管完成特定任务所需的单次推理成本有所增加,但当前最先进的AI模型执行同等任务的总成本仍仅约...

Read More
2026-01-07 talkingdev

开源|AI Observer:统一本地可观测性平台,实时监控AI编程助手成本与性能

近日,GitHub上开源了一个名为AI Observer的项目,它是一个自托管、单二进制文件、兼容OpenTelemetry的可观测性后端,专门设计用于监控本地AI编程工具。该项目旨在解决开发者在同时使用多种AI编程助手(如GitHub Cop...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page