近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...
Read More近日,一个名为 Open-Inspect 的开源后台编码代理系统在开发者社区引起关注。该系统专为单租户部署设计,允许用户在共享开发环境中实时协作执行各类编码任务。与传统编码助手不同,Open-Inspect 强调后台持续运行与...
Read MoreMindwalk是一款专注于提升编程智能体交互透明度的可视化工具,它通过将整个代码仓库抽象为一座三维城市地图,来重放编程Agent的工作会话。在这个独特的“城市场景”中,文件结构化作街区与建筑,Agent的浏览路径、编辑...
Read MorePostgreSQL虽以稳定著称,但在缺乏专职DBA的团队中,宕机事件远比想象中普遍。文章系统梳理了困扰一线运维的四大类问题:一是vacuum进程未及时清理死元组,导致表膨胀和查询性能雪崩;二是事务ID回卷(wraparound)...
Read More一项新研究探索了利用稀疏技术高效训练大语言模型的方法,旨在显著减少算力开销的同时保持模型性能。该方案通过引入结构化稀疏与动态剪枝策略,在训练前期识别并冻结低重要性参数,使有效参数量呈指数级下降,从而降...
Read More在执行复杂的长程任务时,智能体常常面临“行为状态衰减”困境:随着交互轨迹不断拉长,大量与决策相关的关键信息,如任务要求的变化、环境反馈、过往失败尝试的诊断以及尚未完成的子目标,会逐渐被淹没在上下文窗口中...
Read More据彭博社报道,中国人工智能实验室智谱AI(Z.ai)的创始人唐杰在一份内部备忘录中鲜明表态,主张前沿人工智能的能力应当保持“尽可能开放与广泛可及”。作为国产大模型GLM系列的研发者,智谱AI长期践行开源战略,其Cha...
Read More人工智能治理正走向决定性时刻。知名AI专栏作者Nathan Lambert在Interconnects AI上撰文警告,开放权重(open weight)人工智能模型正面临一场可能决定其命运的美国政策考验。文章指出,以Anthropic为代表的闭源阵营...
Read More