语音生成的相关内容 - 漫话开发者

2026-01-23 talkingdev

开源|通义千问Qwen3-TTS系列全面开源：支持语音克隆、音色设计与多语言生成

阿里云旗下通义千问团队正式宣布，其Qwen3-TTS系列语音生成模型现已全面开源。该系列模型代表了当前语音合成领域的前沿技术水平，集成了语音克隆、音色设计、超高拟人度语音生成以及基于自然语言的语音控制等核心功...

2025-04-22 talkingdev

近日，一款名为Dia的开源权重TTS（文本转语音）模型正式亮相，专注于生成高度拟真的对话语音。Dia作为开放权重的技术项目，允许开发者自由访问和调整模型参数，为语音合成领域提供了新的工具选择。该模型通过优化对...

2025-04-18 talkingdev

Hugging Face平台最新发布的SIFT-50M（Speech Instruction Fine-Tuning）数据集，是一个包含5000万样本的大规模语音指令微调数据集，专为语音-文本大语言模型（LLMs）的指令微调和预训练而设计。该数据集基于公开可...

2025-04-04 talkingdev

近日，开源社区迎来一款突破性的语音合成模型Zonos TTS，该模型基于Apache 2.0协议发布，具备语音生成与克隆能力。其核心技术亮点包括：1）支持多语言合成，打破传统单一语种限制；2）采用实时生成架构，延迟低于200...

2025-03-18 talkingdev

近日，Sesame发布了一款1B规模的对话语音生成模型，并在GitHub上开源了其Apple原生MLX版本。该版本专为在MacBook等苹果设备上高效运行而优化，展示了机器学习在移动设备上的应用潜力。MLX是苹果公司推出的机器学习框...

2025-03-10 talkingdev

近日，一款轻量级的自回归流式文本转语音模型在GitHub上发布。该模型仅包含3000万参数，能够与任何语言模型（LLM）结合，使其具备理解和生成语音的能力，以响应通用查询。这一技术的核心优势在于，它无需对底层模型...

2025-03-06 talkingdev

近日，GitHub上发布了一款名为Spark Text To Speech的语音克隆模型，该模型基于Qwen架构，能够通过文本输入生成高质量的语音。值得注意的是，该模型支持情感提示功能，用户可以通过输入情感指令来调整生成语音的情感...

2023-11-14 talkingdev

Bark是一种文本转语音系统，它可以生成连贯、快速和超长的音频输出。现在，我们可以在Jupyter Notebook中使用Bark，将文本转换为语音文件，使其更加便捷。Bark使用深度神经网络作为其文本到语音模型，具有很高的准确...