漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-20 talkingdev

开源|ReactBench:专为编码代理设计的React实战评估框架

ReactBench 是一个开源的编码代理评估框架,专注于在接近真实的 React 开发任务中衡量代理的编程能力。与传统仅要求代码通过行为测试的基准不同,ReactBench 引入了更全面的评价维度,要求生成的解决方案在满足功能...

Read More
2026-07-12 talkingdev

OpenAI 揭露编程评估基准 SWE-Bench Pro 近三成任务存缺陷,建议撤回升级推荐

OpenAI 近期对当前广泛使用的 AI 编程能力评估基准 SWE-Bench Pro 进行了一次系统性审计,结果发现约 30% 的任务存在严重瑕疵,令该基准的可靠性与准确性备受质疑。此次审计由 Anthropic 团队执行,结合了自动化筛查...

Read More
2026-02-19 talkingdev

AI安全攻防新标杆:OpenAI与Paradigm联合发布智能合约漏洞评估基准EVMbench

OpenAI与知名加密投资及研究机构Paradigm近日联合推出了名为“EVMbench”的全新基准测试。该基准旨在系统性地评估人工智能(AI)代理在检测、修补以及利用高严重性智能合约漏洞方面的综合能力。智能合约作为区块链生态...

Read More
2026-02-18 talkingdev

Cohere发布Tiny Aya系列开源模型,手机端也能运行的高性能多语言AI

Cohere的研究部门Cohere Labs近日正式发布了Tiny Aya系列开源模型,这是目前在其参数量级上性能最强的多语言开源模型。该系列包括基础模型TinyAya-Base(35亿参数)以及经过指令微调的TinyAya-Global和多个区域变体...

Read More
2026-02-06 talkingdev

Anthropic发布Claude Opus 4.6:旗舰模型全面升级,推理与编程能力再攀高峰

人工智能公司Anthropic正式发布了其旗舰模型Claude Opus的最新版本——Claude Opus 4.6。此次升级标志着大模型在智能体能力、任务持久性和复杂场景应用上取得了显著进步。该模型在智能体编码、计算机使用、工具调用、...

Read More
2026-02-03 talkingdev

开源模型逆袭!GPT-OSS 120B通过DPO微调,在人类偏好对齐任务上超越GPT-5.2

一项最新研究显示,通过对开源大语言模型进行高效的微调,其性能可以超越顶尖的闭源模型。研究团队采用直接偏好优化方法,仅使用5400对偏好数据对GPT-OSS 120B模型进行训练,使其在RewardBench 2评估基准的人类偏好...

Read More
2025-12-03 talkingdev

Perplexity推出BrowseSafe:为AI浏览器智能体构建实时防护盾,抵御提示注入攻击

人工智能研究公司Perplexity近日开源了其最新研究成果“BrowseSafe”,这是一个专门为保护AI浏览器智能体(AI Browser Agents)而设计的实时内容检测模型与基准测试套件。在开放世界的网页环境中,AI智能体在执行网页...

Read More
2025-09-26 talkingdev

OpenAI推出GDPval:衡量AI模型在44个职业中真实任务表现的新基准

OpenAI近日发布了名为GDPval的创新评估基准,该基准专注于测试人工智能模型在44种不同职业领域内具有经济价值的真实任务上的性能。这一评估体系突破了传统学术基准的局限,通过模拟律师文档分析、会计师报表处理、客...

Read More
  1. Next Page