谷歌TPUv7 Ironwood的第三方推理结果首次在InferenceX官方预览中亮相。在与Nvidia B200/B300进行同口径FP8对比时,Ironwood每美元性能最高可领先50%,意味着单位成本下能够提供明显更强的推理吞吐。值得关注的是,Ir...
Read MoreOpenAI研究员Jakub Pachocki近日在《An Alien Mind》一文中对人工智能能力的快速提升表达了审慎担忧。他指出,具备推理能力的模型可能持续高速进化,甚至达到能够参与自身研发的程度。这种自加速趋势一旦形成,将带...
Read MoreNVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...
Read MoreOpenAI正式预览了GPT-5.6 Sol的Ultrafast模式,该模式在推理速度上实现显著突破,最高可生成750个输出token/秒,整体处理速度达到标准模式的14倍。值得关注的是,这一性能提升并非通过切换更小的轻量模型来实现,而...
Read More知名开发者antirez(Redis之父)在GitHub上推出了新项目h3-metal,将MiniMax最新的H3模型原生带入苹果芯片生态。该项目并非简单的模型移植,而是一个完全面向Apple Silicon的推理引擎,当前已支持prompt直接生成视频...
Read More美国芯片巨头AMD已同意收购多伦多AI芯片创业公司Taalas。这家由前AMD员工及Tenstorrent核心成员创立的公司,专注于将AI模型“硬连线”进定制硅片,从而在前沿推理场景中大幅打破计算与内存瓶颈。与传统依赖通用GPU或庞...
Read More人工智能安全公司Cogent推出了其最新的前沿网络推理模型VR-1,该模型经过专门的后训练,能够自主探查陌生企业环境、组合跨系统弱点,并通过实际执行验证攻击路径。VR-1的核心能力在于模拟真实攻击链:从有限初始访问...
Read MorePetals 是一个颠覆性的点对点网络平台,它让普通用户能够在自己家中,仅凭消费级GPU甚至是免费的Google Colab笔记本环境,就运行起像 Llama 3.1、Mixtral、Falcon 和 BLOOM 这类巨型语言模型。其核心技术思路是将大...
Read More