FEATURED · 精选文章

如何在本地电脑上快速运行Higgs Audio v3 TTS:面向新手的完整指南

发布时间 / 2026/8/19 18:19:36
来源 / 创域科博编辑部
栏目 / 资讯中心
如何在本地电脑上快速运行Higgs Audio v3 TTS:面向新手的完整指南 如何在本地电脑上快速运行Higgs Audio v3 TTS面向新手的完整指南【免费下载链接】higgs-audio-v3-tts-4b项目地址: https://ai.gitcode.com/hf_mirrors/bosonai/higgs-audio-v3-tts-4b想给视频配一段自然的人声却既不想把文字交给云端又苦于电脑没有NVIDIA显卡Higgs Audio v3 TTS正是为此而生——这是Boson AI开源的4B参数多语言语音合成模型支持100多种语言、零样本语音克隆还能用内联标签控制语气与情绪。花3分钟读完本文你就能在本地电脑上跑通它生成第一段属于自己的语音。Higgs Audio v3 TTS是什么一句话定义与三大亮点一句话定义Higgs Audio v3 TTS是一个约40亿参数的会话式文本转语音模型——它不只是朗读文字而是像真人一样带着情绪、停顿和语气在说话。三大亮点100语言覆盖在102种语言上达到低错误率中英日韩法德西全覆盖零样本语音克隆给一段参考音频即可模仿其音色朗读任意文本43个内联控制标签在文字中直接插入|emotion:elation|这类标签实时调整情绪、语速、停顿甚至加入笑声和咳嗽。架构简而言之文本与音频被Higgs Tokenizer编码成token交给约4B参数的自回归解码器逐帧生成语音token再解码回24kHz波形。详细规格见README.md。先看效果跑通后你能得到什么动手装环境之前先说说甜头。跑通后你可以输入一句中文得到带自然停顿和语气的普通话wav文件句首加|emotion:elation|整句立刻喜气洋洋句中插|prosody:pause|说话更有节奏感提供一段5-10秒的参考人声模型就能克隆该音色去朗读任何文本。你得到的不是机械电子音而是能直接用于播客、视频配音、有声读物的成品级语音。动手实践三步完成本地环境配置准备清单确认硬件与软件Apple Silicon MacM1-M4实测M1 32GB机型峰值内存仅约9-12GB或NVIDIA GPU显存24GB以上更稳走SGLang-Omni路线macOS 12、Python 3.8、最新版pip预留8-10GB磁盘空间存放模型文件。第一步安装MLX-AudioApple Silicon上没有CUDA最省事的方案是MLX-Audio——它直接调用M系列芯片的GPUpip install mlx-audio成功标志命令无报错结束。第二步克隆模型仓库仓库包含model.safetensors权重、config.json配置和tokenizer.json分词器git clone https://gitcode.com/hf_mirrors/bosonai/higgs-audio-v3-tts-4b cd higgs-audio-v3-tts-4b成功标志目录下能看到model.safetensors文件。第三步生成你的第一段语音import mlx_audio model mlx_audio.load_model(./) # 加载本地模型权重 audio model.generate(text你好欢迎使用Higgs Audio v3 TTS。, languagezh) audio.save(output.wav) # 保存为音频文件成功标志目录下出现output.wav播放能听到清晰的普通话。常见安装报错速查表现象原因对策安装失败Python版本过低或pip过旧执行pip install --upgrade pip确认Python 3.8内存不足后台应用占用过多关闭多余程序缩短输入文本音质不佳文本格式或参数不合适核对语言代码适当调低temperature进阶玩法语音克隆与情绪控制实战1. 零样本语音克隆能做什么一段参考音频即可用该音色朗读任意文字。audio model.generate( text这段话将使用参考音频的风格来朗读。, reference_audioref.wav, # 5-10秒清晰人声片段 languagezh, )效果提示参考音频越清晰、与目标文本语言一致克隆效果越好。2. 内联控制标签能做什么实时控制情绪、风格、停顿和音效完整43个标签见PROMPTING.md。text |emotion:amusement||sfx:laughter|哈哈这段真是太好笑了效果提示情绪标签放句首音效标签放在效果发生的位置且音效后要紧跟拟声词。3. 部署为本地服务NVIDIA路线有NVIDIA显卡的话可用SGLang-Omni把模型服务成OpenAI兼容的/v1/audio/speech接口支持并发批处理与流式输出完整步骤见AGENTS.md。避坑清单与FAQQ我的Mac只有8GB内存能跑吗A可以尝试但建议16GB以上。内存紧张就缩短文本、调低max_new_tokens。Q生成速度快吗AM1 Max上生成10秒音频约3-5秒流式模式下首段音频亚秒级返回接近实时。Q必须要独立GPU吗A不需要。Mac靠M系列芯片的GPUMLX-Audio即可完全本地推理。Q能商用吗A默认仅限研究和非商业用途详见LICENSE数字创作者制作播客、视频等内容可免费使用需署名Boson AI的Higgs Audio。未经授权不得克隆他人声音、冒充或用于欺诈请务必遵守授权条款。收尾让本地AI语音为你所用至此你已在本地电脑上跑通Higgs Audio v3 TTS完成安装、首次合成并解锁了语音克隆与情绪控制两个进阶玩法。接下来可以对照PROMPTING.md熟悉43个控制标签调出你想要的声音尝试为播客或视频生成多语言配音有NVIDIA显卡的话按AGENTS.md把它部署成常驻服务。技术门槛没有想象中那么高——装好环境、跑通第一个示例剩下的就是玩起来。去生成你的第一段AI语音吧【免费下载链接】higgs-audio-v3-tts-4b项目地址: https://ai.gitcode.com/hf_mirrors/bosonai/higgs-audio-v3-tts-4b创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻