OpenAI正式推出GPT-5.6系列模型,包含Sol、Terra和Luna三个版本,其中Sol在编码、网络安全和科学研究等任务中展现出领先的智能与效率。该系列模型通过更少的令牌消耗实现更强的性能,单位算力成本显著下降。Sol在多...
Read MoreSpaceXAI 正式推出其最新一代大语言模型 Grok 4.5,该模型被定义为迄今最先进版本,专为三大核心领域深度优化:编码生成与推理、自主代理(Agentic)任务执行以及高复杂度知识工作。与前代产品相比,Grok 4.5 在工具...
Read More在AI辅助软件开发快速演进的当下,本地运行的大语言模型正成为开发者关注的焦点。Martin Fowler官网近日发布了一篇来自ThoughtWorks同事的实践总结,详细记录了在编程智能体场景中使用本地模型的最新体验。该报告指...
Read MoreOpenAI 近期对当前广泛使用的 AI 编程能力评估基准 SWE-Bench Pro 进行了一次系统性审计,结果发现约 30% 的任务存在严重瑕疵,令该基准的可靠性与准确性备受质疑。此次审计由 Anthropic 团队执行,结合了自动化筛查...
Read More埃隆·马斯克旗下的人工智能公司SpaceXAI正式推出了新一代大语言模型Grok 4.5,将其定位为公司在编码、智能代理任务和知识工作领域的最强模型。官方披露,该模型在训练过程中与流行AI编程工具Cursor进行了深度协同优...
Read MoreMeta(原 Facebook)近日在 GitHub 上开源了其内部打磨长达八年的设计系统——Astryx。该系统不仅支撑了 Meta 内部超过 13,000 款应用程序的界面开发,更凭借其 150 多个高可访问性组件和丰富主题体系,展示了在极端规...
Read More随着AI编程工具如Claude Code和GitHub Codex的普及,开发者对自主可控、低成本且注重隐私的替代方案需求日益增长。近日,一篇详尽的教程指南提出,利用开源模型和工具搭建本地编码代理成为新趋势。该指南深入剖析了...
Read More在人工智能领域,开放权重(open-weights)的大语言模型与闭源模型之间的性能差距一直是业界关注的焦点。近日,一项基于“人工分析基准”(Artificial Analysis benchmarks)的预测研究指出,到2026年12月3日,一款能...
Read More