一篇来自LessWrong社区的技术文章深入探讨了2023年至2031年间大型语言模型(LLM)规模扩展的物理极限。文章指出,虽然预训练算力是决定模型规模的关键,但一个常被忽视的硬性约束在于推理时的令牌生成速度。具体来说...
Read MoreMorph LLM近期发布了一系列针对开源代码生成模型的优化技术,旨在解决当前推理效率瓶颈。首先,团队通过训练一个专注于模型自身编码输出(而非通用互联网数据)的“起草模型”(drafter),在投机解码中取得了显著加速...
Read More近日,一篇题为《There is minimal downside to switching to open models》的技术评论文章在Hacker News社区引发了广泛讨论,并迅速获得超过142个点赞和93条评论。文章指出,在人工智能模型日益商业化和封闭化的趋...
Read More近日,一个名为Apertus的开源基础模型项目在技术社区引发广泛关注。该项目旨在打造一款“主权AI”模型,强调在数据、训练和部署上的完全自主可控,以摆脱对少数几家科技巨头闭源模型的依赖。Apertus的出现代表了当前AI...
Read More英国《卫报》记者Aisha Down发布的一份名为“欧洲2031”的推演报告指出,如果欧盟在人工智能竞赛中持续落后于美国和中国,到2031年可能面临严重的经济与政治动荡。该报告通过假设性思想实验,警告欧洲正为在AI领域“梦...
Read More顶级量化交易公司简街(Jane Street)正大力推进AI在交易中的应用,并力图成为AI领域的重要投资者。据《华尔街日报》报道,该公司规模已从少数员工扩张至3500人,并计划今年再招募超500人。在投资布局上,简街今年4...
Read MoreAlphaFold的核心领导者John Jumper在X平台宣布,在Google DeepMind工作近9年后,他将离职并加入人工智能公司Anthropic。Jumper表示,在完成博士学位仅6个月后,Demis Hassabis便大胆任命他领导AlphaFold团队,他对这...
Read More近日,开源社区GitHub上出现了一个值得关注的智能体(Agent)开发框架——Flue。该项目由Withastro团队维护,其核心定位是构建一个可编程的TypeScript沙盒环境,专门用于打造高效执行复杂任务的自主Agent。与传统的需...
Read More