Hugging Face博客介绍了Funes,一个面向编码智能体的本地记忆索引方案。该系统在本地对智能体会话轨迹进行索引,融合向量搜索、BM25和交叉编码器重排序,并返回带有溯源信息的原始文本,而不是经过压缩的摘要。Funes...
Read MoreReal-SWE是一个面向软件工程智能体的新基准,它与常见的HumanEval或SWE-bench不同,不依赖公开数据集中可能被模型记忆的题目,而是从经过许可的私有生产代码库中选取10项真实任务。这些任务包含大量企业业务规则和公...
Read MoreAgentsDock 定位为面向智能体(agentic)AI研究的集成开发环境,核心特点是自托管工作区。开发者可以在自己控制的机器上运行 Claude Code、Codex 等智能体编程工具,并通过桌面端和移动端随时接入。该平台支持连接多...
Read MoreAnthropic联合创始人兼CEO Dario Amodei近日发文指出,前沿AI实验室应当主动放慢能力提升节奏,使安全评估、可解释性研究、安全防护和运营严谨性能够同步跟进。文章提出了一条分阶段推进的治理路径:首先在前沿实验...
Read Moremonday.com 工程团队近日披露了其 feedAgent 生产级智能体护栏方案,强调不应只依赖模型自身能力,而要把可靠性构建为围绕模型的系统工程。该框架覆盖输入清洗、幻觉检查、Schema 约束、执行限制、输出验证、全链路...
Read More在大型语言模型(LLM)落地中,推理成本正成为企业关注的核心瓶颈。ByteByteGo最新指南指出,通过智能模型路由,系统可以将常规请求自动分配给成本较低的轻量模型,而将复杂、高风险任务保留给能力更强的模型。一个...
Read MoreZyphra首席技术官Beren Millidge、Thinking Machines首席科学家兼OpenAI联合创始人John Schulman,以及Baseten模型训练负责人Charlie O'Neill在一场播客中围绕人工智能递归自我改进的前景展开深入讨论。三位专家从当...
Read MoreOpenAI 的 GPT-6-Astra 被评价为迄今原始智能因子最高的模型之一,其在 3D 任务、游戏操作、计算机使用和子代理协同等方面展现出突出能力,多项基准测试相较前代模型出现大幅跃升。虽然编码性能相比 Sol 并未实现量...
Read More