在大型语言模型(LLM)驱动的AI智能体日益普及的今天,如何可靠地评估其在长时间、多步骤任务中的实际生产力,仍是行业面临的核心挑战。GitHub上最新发布的开源项目LHTB(Long-Horizon Terminal Benchmark)正试图填...
Read MoreDeepMind提出了GenCeption,将预训练的视频生成模型重新设计为一种可通过文本指令控制的统一视觉系统,引发学界关注。该模型基于前馈、非自回归的生成式架构,不需要针对下游任务进行微调即可同时处理深度估计、表面...
Read More本文对 xAI 官方发布的 Grok Build 编程命令行工具(CLI)版本 0.2.93 进行了深度的线缆级流量分析,重点探究该工具在与 xAI 服务器交互时实际传输和存储的数据内容。分析结果显示,CLI 会将其读取的文件内容原封不...
Read MoreSakana AI 将其在集体智能领域的探索从软件推向了物理世界,发布了“智能细胞砖”(Smart Cellular Bricks)项目。这种模块化硬件砖块摒弃了传统集中式控制架构,每一块砖都内嵌局部通信模块和小型神经网络,能够通过...
Read More近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...
Read More近日,一个名为 Open-Inspect 的开源后台编码代理系统在开发者社区引起关注。该系统专为单租户部署设计,允许用户在共享开发环境中实时协作执行各类编码任务。与传统编码助手不同,Open-Inspect 强调后台持续运行与...
Read MoreMindwalk是一款专注于提升编程智能体交互透明度的可视化工具,它通过将整个代码仓库抽象为一座三维城市地图,来重放编程Agent的工作会话。在这个独特的“城市场景”中,文件结构化作街区与建筑,Agent的浏览路径、编辑...
Read More著名数学家陶哲轩近日在其博客中分享了如何借助现代“编程代理”类AI工具,以极高效率完成了一系列数学可视化小程序的更新与创建工作。他将自己早在1999年用Java 1.0编写的复分析和线性代数教学小程序,通过AI辅助成功...
Read More