漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-12 talkingdev

论文推荐| Z.ai提出SAO:单次展开异步优化,稳定训练千步,超越GRPO并已部署于GLM-5.2

在大语言模型后训练中,强化学习正变得愈发关键,但面向长周期智能体任务时,传统同步、批次交替的RL流程效率低下。异步强化学习通过随到随更新的方式提升了效率,然而现有系统多偏重吞吐量,训练稳定性和任务有效性...

Read More
2026-07-12 talkingdev

Anthropic提出GRAM方法:为AI模型内的双用途知识装上可关闭的“开关”

AI模型在学习过程中不可避免地会掌握大量“双用途知识”——既能用于网络防御、漏洞检测等正面场景,也可能被用于网络攻击和信息窃取等恶意目的。如何在不削弱模型整体能力的前提下,精准管控这类敏感知识,一直是AI安全...

Read More
2026-07-12 talkingdev

Anthropic 提出 GRAM 方法:为大模型危险知识装上“可拆卸开关”

Anthropic 最新研究提出一种名为 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的方法,旨在以极低的成本实现对 AI 模型中双重用途知识的精细控制。双重用途知识指既可造福社会也可能被滥用的敏感能...

Read More
2026-06-30 talkingdev

强化学习突破“可验证”边界,下一波AI浪潮已至

强化学习(RL)在可验证领域(如棋类游戏、编程代码)的成功已毋庸置疑,但现实世界中大量复杂任务(如机器人操控、制药分子设计、开放域对话)难以通过简单规则或自动脚本进行验证,这构成了RL落地的关键瓶颈。本文...

Read More
2026-06-30 talkingdev

开源| Ornith-1.0:开源自主编程Agent模型发布,代码能力自我进化

近日,一个名为 Ornith-1.0 的开源模型在开发者社区引起了广泛关注。该项目由 deepreinforce-ai 团队在 GitHub 上发布,其核心亮点在于专为“Agentic Coding”(自主代理编程)场景设计,并具备自我改进的能力。基于特...

Read More
2026-06-26 talkingdev

DeepReinforce开源Ornith-1.0编程模型:能自我编写强化学习框架,性能比肩Claude Opus 4.7

DeepReinforce近日开源了其新一代编程模型家族Ornith-1.0,这一系列模型的最大亮点在于具备自我编写强化学习(RL)训练框架的能力,标志着AI模型在自我优化和自动化研究方向上迈出重要一步。Ornith-1.0家族基于预训...

Read More
2026-06-20 talkingdev

嘿,菜鸟,招你不是让你单纯完成任务的

本文来自知名软件工程师、敏捷开发方法创始人之一 Kent Beck 的个人通讯。文章标题颇具挑衅意味,直指当今科技行业对初级开发者(n00b)的一种普遍误解:认为招聘他们进来只是为了执行具体任务。Beck 提出,相较于完...

Read More
2026-06-19 talkingdev

Perplexity发布“自我进化记忆”系统Brain,让AI代理告别“从零开始”

Perplexity AI公司近日在其官方博客中披露了一项名为Brain的新型记忆系统。该系统旨在解决当前AI代理在执行复杂任务时缺乏上下文和长期记忆的痛点。Brain通过构建一个跨任务、项目、决策、文件和资料源的持续上下文...

Read More
  1. Prev Page
  2. 3
  3. 4
  4. 5
  5. Next Page