漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-10 talkingdev

ZeroModels 发布:基于 Keras 3 的预训练模型库,一套代码跑通 JAX、PyTorch、TensorFlow

ZeroModels 是一个完全基于 Keras 3 构建的预训练模型集合,覆盖图像分类、目标检测、分割、单目深度估计、特征提取、视觉语言模型和语音识别等任务。该项目最大的亮点在于同一套代码可原生运行在 JAX、PyTorch 和 T...

Read More
2026-09-08 talkingdev

开源|Qwen-Drive-1.0:打通感知、语言与规划的自动驾驶视觉语言基础模型

QwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理...

Read More
2026-08-28 talkingdev

Cohere发布Parse文档智能模型:支持9种语言,每千页仅1.5美元

Cohere 推出 Parse 文档智能解析服务,可将复杂多模态文件(如文档、表格、图像)转换为结构化、机器可读的数据。该服务基于高成本效益的视觉语言模型,面向企业大规模文档处理场景,能够检测并理解关键视觉元素,并...

Read More
2026-06-18 talkingdev

NVIDIA XR AI公测:为AR眼镜与XR设备打造AI Agent的开源利器

NVIDIA近日宣布其XR AI平台进入公开测试阶段,为增强现实(AR)眼镜和扩展现实(XR)头显开发者提供了一个关键的底层基础设施。该平台是一个开源库,旨在填补当前硬件就绪但缺乏集成本地AI体验的空白。它允许开发者...

Read More
2026-05-04 talkingdev

开源|AutoRound:10分钟单GPU搞定7B大模型量化,极致压缩精度不减

在大型语言模型(LLM)和视觉语言模型(VLM)部署中,模型量化是降低计算和存储成本的关键技术。然而,传统量化方法往往需要在模型大小和推理精度之间做出艰难取舍,尤其是在超低位宽(如2-bit、3-bit)下,精度损失...

Read More
2026-03-19 talkingdev

开源|百度发布千帆VL系列企业级视觉语言模型,专攻文档解析与复杂视觉推理

百度近期在GitHub上开源了其企业级视觉语言模型系列——千帆VL(Qianfan-VL)。该系列模型并非通用型多模态模型的简单变体,而是针对工业场景进行了深度优化和增强的专用模型。其核心设计目标是解决企业级应用中的实际...

Read More
2026-02-27 talkingdev

Cardboard-基于自然语言的AI视频编辑器,让剪辑像对话一样简单

近日,由Saksham和Ishan共同创立的YC W26项目Cardboard正式亮相,这是一款革命性的AI视频编辑工具。用户只需用自然语言描述需求,如“从这段原始素材中制作一个60秒的回顾”或“将其剪成20秒的广告”,Cardboard便能自动...

Read More
2026-01-08 talkingdev

论文推荐|WebGym:为视觉网页智能体构建近30万真实任务的大规模训练场,性能超越GPT-4o

近日,研究人员推出了迄今为止最大规模的开源环境WebGym,专门用于训练能够处理真实世界网页任务的视觉智能体。该环境的核心价值在于解决了现有训练集的局限性:人工合成或小规模任务集无法应对真实网站的多样性和非...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page