OpenAI近期公开了其最新的实时语音交互系统GPT-Live,标志着语音AI从“交替发言”正式迈入“自然共时”的新阶段。该系统以连续语音处理为核心,实现了全双工通信,彻底抛弃了传统语音助手依赖的轮流对话检测机制。在架构...
Read More来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿...
Read MoreMistral AI正式发布Shieldstral,这是一款参数量仅为3B的开放权重多模态安全分类器。它能够同时处理文本与图像输入,并在推理时直接接受用自然语言描述的安全策略,无需针对不同政策重新训练模型。尽管体量轻巧,Shi...
Read MoreMiniMax正式推出开源模型H3,首次在单一模型中打破了任务与模态的边界,实现了文本、图像、视频和音频的统一理解与生成。H3不再是简单的多模态拼接,而是在统一上下文中进行深层语义融合,尤其在视频生成领域带来了...
Read More人工智能公司Thinking Machines正式推出开源权重模型Inkling-Small,以更小的体量实现了与Inkling相当的性能。该模型采用混合专家架构,总参数量达276B,但每次推理仅激活12B参数,大幅降低算力需求。Inkling-Small...
Read More微软研究团队近期发布了Mage,一个专为研究场景设计的轻量级多模态模型家族。该系列模型严格遵循40亿参数的固定预算,在保持紧凑架构的同时,性能足以比肩规模大得多的开源系统。Mage包含两大核心成员:Mage-VL和Mag...
Read More近日,Kimi K3模型的开放权重发布揭示了其架构的诸多细节。该模型本质上是去年发布的Kimi Linear架构的规模化生产版本,整体设计明显向着更高的推理效率演进。K3现已原生支持多模态输入,进一步拓宽了应用边界。本次...
Read More英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...
Read More