Modal的相关内容 - 漫话开发者

2025-05-02 talkingdev

谷歌医疗AI突破：AMIE新增医学影像分析能力，实现类医生精准诊疗

谷歌研究团队近日宣布其医疗对话AI系统AMIE（Articulate Medical Intelligence Explorer）取得重大升级，新增医学影像分析功能。这一突破性进展使AMIE在基于聊天的诊断过程中能够同步解读X光片、CT扫描等医学影像，...

2025-03-31 talkingdev

近日，GitHub上出现了一个名为'awesome-multimodal-adaptation'的开源项目，该项目系统性地整理了多模态自适应领域的最新研究进展。该项目不仅涵盖了传统的领域自适应方法，还包括测试时自适应等新兴技术方向。多模...

2025-03-25 talkingdev

Baichuan Omni 1.5 是一款支持文本、图像、视频和音频输入以及文本和音频输出的开源全模态基础模型。该模型采用任意到任意（any-to-any）的设计风格，属于原生多模态模型的一种典型代表。其核心技术在于使用了交错的...

2025-03-25 talkingdev

LLaVA-MORE 是一项关于多模态大语言模型（Multimodal Large Language Models, MLLMs）的系统性研究，旨在评估不同语言模型和视觉骨干网络在 MLLMs 中的表现，并提供一个可复现的框架来比较这些架构。通过该研究，研...

2025-02-27 talkingdev

微软近日发布了两款全新的开源语言模型Phi-4-mini和Phi-4-multimodal，这两款模型在硬件效率和多模态处理方面表现出色。其中，Phi-4-mini拥有38亿参数，专注于文本任务；而Phi-4-multimodal则具备56亿参数，能够处理...

2025-02-26 talkingdev

近日，R1-OneVision作为一种多功能的大型多模态模型，正式在GitHub上发布。该模型通过整合视觉与文本数据，在数学、科学、深度图像理解及逻辑推理等复杂任务中表现出色。R1-OneVision的设计旨在解决传统单一模态模型...

2025-01-24 talkingdev

LOKI 是一个用于评估视觉语言模型（VLMs）在检测新颖和具有挑战性项目方面表现的合成基准测试工具。该基准测试通过生成复杂的多模态数据，帮助研究人员更好地理解模型在处理未知或复杂场景时的能力。LOKI 的设计旨在...

2025-01-22 talkingdev

近日，GitHub上发布了一个名为DETRIS的参数高效调优框架，该框架专注于提升多模态任务中视觉特征的传播效率。DETRIS通过密集互连和文本适配器（text adapters）来增强视觉特征的传播，特别是在编码器未对齐的情况下...