Mistral AI 正式发布 OCR 4.1,这是一款高度专用的视觉多模态模型,核心目标是摄取、解析并结构化复杂文档格式。该模型在复杂表格布局识别、层级文档结构理解方面表现突出,能够直接输出干净且机器可读的 JSON 或 Ma...
Read More微软宣布其最新文本到图像模型MAI-Image-2.6在Arena文本到图像排行榜上首次亮相即升至第二位,排名超过Google、Meta和xAI等竞争对手。Arena排行榜基于用户盲测与偏好投票,是评估生成模型综合表现的重要公开基准之一...
Read MoreGoogle 官方宣布旗下人工智能助手应用 Gemini 已实现超过 10 亿月活跃用户,成为谷歌产品矩阵中第 14 个达成这一里程碑的应用。尽管谷歌未披露各平台的详细分布,但透露用户在 iOS 端的活跃度同样破亿,且日均生成图...
Read More阿里巴巴通义千问团队在GitHub上正式开源了Qwen-MM-Plugins项目,这是一个专为Qwen模型设计的原生多模态插件集合。该项目的核心目标是让任意基于大模型的智能体能够直接“看”懂多种模态信息,而不仅仅局限于文本交互...
Read More知名开发者antirez(Redis之父)在GitHub上推出了新项目h3-metal,将MiniMax最新的H3模型原生带入苹果芯片生态。该项目并非简单的模型移植,而是一个完全面向Apple Silicon的推理引擎,当前已支持prompt直接生成视频...
Read More中国人工智能初创公司月之暗面(Moonshot)近日迈出了上市规划的关键一步。根据企业备案文件披露的信息,月之暗面已将其在中国的主体从有限责任公司正式重组为股份有限公司。此次股改被视为该公司为在香港进行首次公...
Read More据《金融时报》援引知情人士消息,TikTok母公司字节跳动正在预训练一个参数量高达10万亿的超大规模人工智能模型。这一数字大约是月之暗面Kimi K3模型参数量的三倍,也超过了Anthropic传闻中Mythos 5约8万亿参数的预...
Read More字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...
Read More