在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...
Read More通义千问团队正式发布了其新一代旗舰模型Qwen3.8-Max,该模型以惊人的2.4万亿参数量,在编码、办公协同、深度研究及长周期任务处理等多个维度实现了代际跨越。不同于仅能提供简单问答的常规模型,Qwen3.8-Max展现出...
Read More据《金融时报》报道,苹果公司近日针对其安全漏洞悬赏计划(Apple Security Bounty)引入了一项重大调整:对bug报告的提交数量设置上限,并强制执行30天的提交冷却期。这一前所未有的举措直接指向由生成式人工智能引...
Read More一项针对生命科学临床与监管场景的基准测试ClinReg显示,开源权重大语言模型在准确率上已追平顶尖闭源模型。测试中,GLM 5.2、Kimi K3等开源模型在监管和临床任务上的表现与GPT 5.6 Sol等商业模型的差异落在一个标准...
Read More谷歌DeepMind正式发布了新一代机器人AI系统Gemini Robotics ER 2,该系统在视频理解、工具编排和多机器人协作方面实现了阶跃式突破。ER 2将先进的Gemini大语言模型与机器人深层控制相结合,使机器人不仅能够更精准地...
Read More在大语言模型走向产业级部署的进程中,如何在不显著牺牲质量的前提下降低推理成本和响应时延,是各家前沿实验室竞相突破的核心瓶颈。OpenAI工程师团队首次较为系统地披露了支撑ChatGPT及Codex高效运转的智能体循环(...
Read More英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...
Read More在依赖类型语言的世界里,强大的类型系统往往意味着沉重的证明负担——开发者可能需要花费数小时才能发现要证明的命题根本就是错误的。这种高昂的认知开销使依赖类型编程长期停留在小众领域。如今,这一局面正在被打破...
Read More