漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-20 talkingdev

开源|ReactBench:专为编码代理设计的React实战评估框架

ReactBench 是一个开源的编码代理评估框架,专注于在接近真实的 React 开发任务中衡量代理的编程能力。与传统仅要求代码通过行为测试的基准不同,ReactBench 引入了更全面的评价维度,要求生成的解决方案在满足功能...

Read More
2026-07-20 talkingdev

开源|LoopGain:让AI智能体循环在收敛时自动停止,告别固定迭代上限的成本黑洞

LoopGain 是一款专为 AI 智能体循环设计的开源成本控制器,致力于解决当前多智能体框架中普遍存在的“固定最大迭代次数”所导致的算力浪费和输出质量退化问题。其核心创新在于引入实时“环路增益(Aβ)”监测机制:当系...

Read More
2026-07-18 talkingdev

数据基础设施公司Cribl斥资约1亿美元收购AI威胁检测初创CardinalOps,加速安全数据赛道布局

美国遥测与数据基础设施明星企业Cribl宣布收购以色列AI安全初创公司CardinalOps,知情人士透露交易金额约为1亿美元。CardinalOps此前累计融资4000万美元,专注于运用人工智能提升威胁检测工程的自动化水平,其平台能...

Read More
2026-07-17 talkingdev

GPT-5.6 引入 Codex 多模型分工体系:Sol、Terra、Luna 各司其职,Sol Ultra 解锁深度推理与多智能体协同

OpenAI 最新推出的 GPT-5.6 在 Codex 开发环境中首次引入了一套精细化的多模型任务分配机制,将工作负载自动分流至 Sol、Terra 和 Luna 三个特性鲜明的执行单元。其中,Sol 专门应对目标模糊但价值极高的复杂问题,...

Read More
2026-07-17 talkingdev

谷歌最强AI模型Gemini 3.5 Pro被曝延期,Alphabet股价下跌4%

据CNBC报道,谷歌母公司Alphabet股价在最新消息传出后下跌4%,起因是有报道称其旗下最强大的AI模型Gemini 3.5 Pro遭遇延期。早在今年5月,Alphabet就已宣布了Gemini 3.5 Pro模型,并表示该模型已在内部使用,但需等...

Read More
2026-07-17 talkingdev

Moonshot 发布 Kimi K3:2.8万亿参数多模态巨擘,百万Token上下文与代理编码能力全开

国内人工智能公司 Moonshot 正式推出新一代旗舰多模态模型 Kimi K3,参数规模高达 2.8 万亿,并原生支持 100 万 token 的超长上下文窗口。K3 的亮点不仅在于规模,更在于工程上的深度优化:团队针对长上下文场景大幅...

Read More
2026-07-16 talkingdev

首次实验验证递归自我改进:AI自主优化八天,超越人工两年调优成果

研究人员首次在实验中观察到递归自我改进(RSI)现象。他们让一个“自我研究”智能体在自主研究程序上连续运行了八天,最终该系统在预留的基准测试上击败了团队花费两年时间手工调优的测试框架。这套完全自主的系统包...

Read More
2026-07-14 talkingdev

OpenAI发布GPT-5.6-Sol:更廉价的“劳模”模型登场,同时推出Terra与Luna

OpenAI最新推出的GPT-5.6-Sol模型被视为一款成本效益极高且运行高效的AI系统,尤其适合日常编程与工程任务,堪称继前代版本之后更为稳定可靠的“主力军”。与此前动辄耗费大量算力的旗舰模型不同,Sol在保持强大代码理...

Read More
  1. Prev Page
  2. 5
  3. 6
  4. 7
  5. Next Page