漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

OpenAI发布ChatGPT Images 2.5:细节更锐利、编辑更可靠,延迟最高降低50%

OpenAI 正式发布 ChatGPT Images 2.5,新一代图像生成模型在细节呈现、参考图还原和编辑稳定性方面实现显著升级。官方介绍显示,该版本能输出更锐利的图像细节,在融合用户提供的草图或参考照片时拥有更强的保持能力...

Read More
2026-08-27 talkingdev

Meta推出Muse Image图像生成模型:先推理后渲染,单图成本仅0.01美元

Meta推出的Muse Image图像生成模型,其核心特点在于能够基于搜索结果进行图像生成,并在最终渲染前执行推理过程。这意味着模型不再仅依赖训练数据中的视觉模式,而是可以结合外部信息来约束生成结果,有望提升图像的...

Read More
2026-08-13 talkingdev

微软MAI-Image-2.6空降Arena文生图榜第二,超越Google、Meta与xAI

微软宣布其最新文本到图像模型MAI-Image-2.6在Arena文本到图像排行榜上首次亮相即升至第二位,排名超过Google、Meta和xAI等竞争对手。Arena排行榜基于用户盲测与偏好投票,是评估生成模型综合表现的重要公开基准之一...

Read More
2026-08-12 talkingdev

里程碑:Google Gemini 月活跃用户突破 10 亿,跻身谷歌第 14 款十亿级产品

Google 官方宣布旗下人工智能助手应用 Gemini 已实现超过 10 亿月活跃用户,成为谷歌产品矩阵中第 14 个达成这一里程碑的应用。尽管谷歌未披露各平台的详细分布,但透露用户在 iOS 端的活跃度同样破亿,且日均生成图...

Read More
2026-07-29 talkingdev

微软推出轻量级多模态模型家族Mage:4B参数实现高效训练与部署

微软研究团队近期发布了Mage,一个专为研究场景设计的轻量级多模态模型家族。该系列模型严格遵循40亿参数的固定预算,在保持紧凑架构的同时,性能足以比肩规模大得多的开源系统。Mage包含两大核心成员:Mage-VL和Mag...

Read More
2026-07-24 talkingdev

微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash:高保真图像生成和超低延迟语音模型正式公开预览

微软正式推出两款全新自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,进一步强化其在多模态生成领域的布局。MAI-Image-2.5-Pro专注于高保真图像生成与编辑,能够根据复杂文本描述生成细节丰富、构图精准的高质...

Read More
2026-07-22 talkingdev

通义千问发布Qwen-Image-3.0图像生成模型:支持4.5k token输入,原生渲染12种语言

阿里巴巴通义千问团队近日正式推出第三代基础图像生成模型Qwen-Image-3.0,在内容丰富度、细节真实感和世界知识融合方面实现全面升级。该模型支持最高4.5k token的文本输入,能够精准理解复杂长文本的语义,并生成富...

Read More
2026-07-12 talkingdev

Ideogram V4 图像生成突破性提速:0.44 秒出图且画质无损,推理速度提升 6 倍

人工智能图像生成平台 Ideogram 发布 V4 版本,其在 fal 推理服务上实现了令人瞩目的性能飞跃。在 1K 分辨率下,单张图像的生成时间从原先的 2.75 秒锐减至 0.44 秒,提速达到 6 倍以上,且视觉质量无明显下降。这一...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page