谷歌正式发布Gemini 3.7 Flash,官方称其为目前面向编码与智能体场景最智能的主力模型。该版本在软件工程和Web开发任务中显著提升准确性与效率,并以比前代更低的成本提供,意味着开发团队可以在更复杂、更长周期的...
Read More微软正式发布 MAI-Thinking-1,这是一款面向企业工作负载的中等规模推理模型,重点提升编码、数学和知识类任务中的成本效率。该模型强调在推理能力与部署成本之间取得平衡,适合需要大规模调用又对响应速度和预算敏...
Read MoreQwen团队在Hugging Face发布Qwen3.8-2.4T-A95B模型。该模型基于Qwen3.5架构演进而来,重点提升编码与长时程任务处理能力,并通过改进的智能体执行机制提高任务完成可靠性。它支持SGLang、vLLM等主流部署框架,可较顺...
Read More知名AI编程工具Cursor正在加紧准备推出其代码审查平台Origin,内部代号为“Cursor Review”,该平台将在前期封闭合作测试的基础上正式对外开放。据悉,Cursor Review将新增两个核心功能页面:一是“Codebase”页面,负责...
Read More随着大语言模型越来越多地参与代码生成,软件开发生命周期正面临前所未有的挑战:代码上线速度快了,但失控风险也随之增加。LaunchDarkly 推出的 CodeControl 平台正是为了解决这一矛盾,帮助团队对AI生成代码的执行...
Read MoreGenerative UI(生成式用户界面)正试图从根本上改变人机交互的形态,它将传统AI聊天中冗长的“文字墙”替换为根据用户意图动态生成的交互界面。这一范式被划分为三类生成模式:静态/受控生成,模型仅选择工具参数,由...
Read More在人工智能编码工具日趋复杂化的浪潮中,一款名为 Pi 的工具却以极简设计逆势突围。Pi 仅向用户提供四种工具,且其系统提示词被严格压缩在 1000 个 token 以内。这一看似“缩水”的策略,在多项实际测试中展现出更优的...
Read MoreEpoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...
Read More