小龙哥经验包 · 经验 002

三套已经跑通的声音生产线,直接开箱带走

AI 语音合成:小龙哥的低配、中配、高配

不用先研究一堆模型名。从免费开口、日常双主播到正式节目,这篇把小龙哥已经调过、测过、做进风神播客的三条路线讲清:你的电脑能跑哪一档、模型到底是什么,以及可以直接复制的开箱入口。

文章播客 / NO AUTOPLAY

不想读,就从这里听。

不是逐字念文章,而是把同一个问题重新讲成一期节目;点击后才播放。

A · 低配版Edge 晓晓 / 云希
B · 中配版LuxTTS 宁宁 / 明明
C · 高配版Qwen3-TTS 风神声音 2.0

一句话结论:AI 语音合成不是选一把“最强的嗓子”,而是给不同内容准备一条能稳定复用的生产线。小龙哥把它整理成低配、中配、高配三档:你可以先听,再按自己的机器和目标把整套经验带走。

先把主题说清:AI 语音合成到底在解决什么

它做的事情很简单:把你写好的文字,变成可以发布、可以反复生产的声音。

真正难的不是让电脑读出一句话,而是让它在十分钟、二十分钟以后仍然做到四件事:像同一个人、读得完整、听起来舒服、下次还能复现。于是这篇不按“哪个模型最新”来讲,而是按你要交付什么来讲:

你要做的事先选哪一档为什么
快讯、草稿、临时试听、先把文字变成声音低配最快、最轻、上手成本最低
日常知识播客、双主播朗读、想在自己的电脑上批量做中配本机轻量,能用有授权的参考声做稳定克隆
品牌节目、长期栏目、想冻结一套声音身份高配人物感和表达上限更高,适合认真做成品

这里的“免费”不是说电脑、电力和时间都不要成本;它的意思是:不把长期生产线建立在按字符持续付费的托管 API 上。具体模型、服务条款和许可证仍以各自官方页面为准。

先看电脑:你的机器该从哪一档开始

别被“低/中/高”三个字误导成音质鄙视链。它首先是三条不同的资源路线。下面的内存数,来自小龙哥这套实际生产链的记录,不是给所有电脑的绝对承诺。

你的电脑最稳的起点能做什么不该期待什么
8GB 内存的普通 Windows/Mac低配 Edge快速把文字变成晓晓/云希的声音,做试听、快讯和草稿不要尝试在本机跑高配 1.7B Base;网络可用比显卡更重要
Apple Silicon 16GB 统一内存低配 + 中配 LuxTTS用有授权的参考声做短样、日常双主播和小批量内容不把 8GB 或 16GB 当成长节目高配的稳定生产配置
Apple Silicon 32GB 及以上统一内存三档都可评估可以进入 Qwen3-TTS 高配的正式节目流程仍要先跑短样和机器检查,内存大不等于声音身份正确
NVIDIA/Windows/Linux低配先开箱;本地路线按显存实测Edge 不依赖本机 GPU;有 CUDA 时可评估本地 Qwen不要把系统内存当显存,也不要拿没测过的显卡直接承诺长节目

小龙哥实测的中配 LuxTTS 在 Apple Silicon MPS 上,模型运行量级约 1.40GB;但这不是整台电脑只需要 1.40GB——macOS、Python、音频缓存和其他应用都要留空间,所以 8GB 只适合从低配开始,16GB 才建议认真尝试中配

高配的实测路线是 mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16,一次生产的 Metal 峰值约 10.75GB。这意味着 8GB 统一内存跑不了高配;16GB 只能把它视为短样和压力测试边界,做正式长节目请从 32GB 统一内存起步。NVIDIA 的可行性要单独按显卡、CUDA、驱动和实际显存测,不用一句“电脑有 16GB 内存”混过去。

三档不是口号:模型、声音和边界都在这里

低配:Edge TTS —— 先稳定开口

  • 服务:edge-tts
  • 女声:zh-CN-XiaoxiaoNeural(晓晓)
  • 男声:zh-CN-YunxiNeural(云希)
  • 最适合:快讯、草稿、一次性试听、低成本大批量内容
  • 你需要知道的限制:这是在线服务,不是你本机的私有声纹;它追求的是快和稳,不是人物克隆

低配不是“差”。它的价值是你不必先买显卡、下载大模型,几分钟就能判断一篇稿子值不值得做成音频。风神播客的健康节目也曾使用这一档,说明它能进入真实发布;只是当内容要变成长期品牌声音时,就该进入更严格的身份冻结流程。

中配:LuxTTS —— 本机日常生产的甜点位

  • 模型:YatharthS/LuxTTS
  • 当前固定思路:干净的授权参考 WAV、约 10–14 秒参考、rms=0.01num_steps=4t_shift=0.9speed=0.92
  • 最适合:日常知识播客、双主播栏目、小说或长文朗读
  • 你需要知道的限制:参考声里的噪声、口音和距离感也会被一起带进去;每次生成的候选仍要筛选

中配的意义是把“能听”推进到“能日常生产”。它能在 Apple Silicon 的 MPS 上跑,资源比高配轻得多;但它不是随便找一段声音就能克隆。你必须拥有参考声的使用权,并把参考文本和音频对齐。

高配:Qwen3-TTS —— 风神播客正式节目的声音线

  • 实测模型:mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16
  • 对应官方 Base:Qwen/Qwen3-TTS-12Hz-1.7B-Base
  • 当前声音合同:风神声音 2.0,宁宁 02/明明 09
  • 最适合:正式长节目、品牌角色、需要长期保存和复用的内容
  • 你需要知道的限制:更吃本机资源;声音身份依赖“参考音频 + 逐字匹配的参考文本 + 固定 seed + 固定版本”,不是只选一个预置音色

高配也不是“一键神音”。它正确的顺序是先为有授权的声音选角,再冻结锚点、参数和 seed;长稿按短语义段生成,失败段整段重来。这样做慢一点,却能避免一段一个人、越做越像抽卡。

先听,再决定:三条同稿试听在文章上方

文章上方的 A/B/C 三段,使用同一份中英双语男女对话稿、相近响度和统一输出格式。先用耳朵做第一轮选择:

  1. 英文切回中文时,还是不是同一个人?
  2. 男女接话时,是不是像在同一个空间?
  3. 句尾、停顿和语速,会不会让你听两分钟就累?

机器门禁随后才检查解码、异常静音、重复、漏句、响度和资源消耗。分数通过不等于你会喜欢这把声音;它只证明这次生成没有明显的工程事故。

这三档不是一天想出来的:小龙哥走过的弯路

这篇不是把网上三个模型名排一排。为了找到“像真人、能长期听、又不被调用费绑住”的路线,小龙哥前后走过腾讯云、Microsoft Edge、macOS 系统音色、VoxCPM2、CosyVoice、Qwen3-TTS、LuxTTS 等至少七条模型或服务路线,留下了百余条可追溯的候选音频。

最早,腾讯云先解决了“能播”,也让人很快看见长期按量调用的成本;Edge 让“随时开口”变得足够轻,但它没有解决品牌声音的身份问题。后来本地开源开始有了想象力:VoxCPM2 的 Voice Design 很惊艳,可一进长段,就出现过声音撕裂、英文残片、莫名 BGM/nospeech 和数字丢失。那些失败没有被剪掉后装作没发生,而是成了“不进正式线”的红线。

Qwen3-TTS 也不是一上来就稳定。早期把 CustomVoice 的预置演员当成宁宁/明明,实际人耳一听就发现身份走样;后来又发现,不冻结 seed、参考音频和逐字匹配的参考文本,长稿会像不断抽卡。最后才收口为“先选有授权的声音,再用 Base 模型固定锚点、文本、参数和 seed”。LuxTTS 则在另一端把克隆速度和资源占用压到日常能用,成为中配。

所以留下三档不是因为小龙哥只试了三个答案,而是因为很多看起来更炫的路线,在长文、双语、数字、连续性、成本或复现性上没有过关。你拿走的不是一个漂亮名字,而是一条已经把坑写在前面的路。

风神播客已经把它做进真实节目,而不只是放三段样音

三档试听是为了让你横向比较;风神播客的近期节目则检验一条声音线能不能承受真实内容。

最近上线的三期「风神方法」,都使用宁宁与明明的 Qwen3-TTS 风神声音 2.0 高配版:

这三期不是拿原文机械朗读:宁宁主讲,明明追问;它们累计超过半小时,作为“高配适合正式节目”的真实生产证据。反过来,风神播客里也保留了 Edge 低配的公开节目。结论不是三档谁淘汰谁,而是不同目标用不同路线。

直接开箱:你可以从这里开始

如果你只想最快做出自己的第一段音频,不必先读完所有技术细节,按下面走:

  1. 先到 三档试听与声音包 听 A/B/C。
  2. 下载 完整三档经验包,里面有试听、模型信息、提示词和质量边界。
  3. 打开 开箱即用安装说明,或者把页面里的「宁宁明明一键开箱母提示词」原样交给 Codex、WorkBuddy 等编码 AI。
  4. 不要直接要求“装好 TTS”。让它完成一段真实问候音频、做完机器检查,再把新的一轮结果和旧结果对照。

给编码 AI 的最短施工单可以这样写:

我要在自己的电脑上开箱 AI 语音合成,请先检测系统、芯片、内存、GPU、Python、ffmpeg、磁盘空间和已有模型缓存。

优先给我一条能完成的路线:
1. 机器或本地模型不合适时,用 Edge TTS 生成女声 zh-CN-XiaoxiaoNeural 和男声 zh-CN-YunxiNeural;
2. Apple Silicon 且我提供了有授权的参考 WAV 时,可以评估 LuxTTS;
3. 只有我提供了有授权的参考音频、逐字匹配的参考文本和确认文件时,才进入 Qwen3-TTS Base 克隆。

请把每次运行放进新的目录,不覆盖旧结果;生成一段中英混读的问候 MP3 后,检查完整解码、48kHz、单声道、时长、响度、异常静音和 SHA-256。不要把预置演员冒充成我的专属声音,不要自动播放或上传。

把经验抄走时,最容易踩的四个坑

  • 把预置音色叫成自己的主播。 名字只是标签;真正的身份来自你有权使用的参考声、准确文本和被冻结的参数。
  • 把固定 seed 当成万能药。 Seed 能减少漂移,不能把错误音色变正确,也不能弥补参考文本不一致。
  • 让“更响”伪装成“更好”。 比较前先统一响度;短问候不要用一次动态响度处理把噪声一起推高。
  • 把机器通过写成人耳验收。 机器只能证明生成完整、格式合格;自然度、身份和能不能长听,必须由人耳决定。

一套能长期复用的验收线

做完一条音频后,至少留下这些东西:原始参考 WAV、参考文本、模型 ID、版本、参数、seed、生成日志、成品 SHA-256 和测试结论。再分别回答:

  • 它是否完整解码、没有异常静音或明显吞句?
  • 它是否仍像同一个声音,而不是每段换一个人?
  • 你是否拥有参考声的使用权?
  • 下个月换一台机器,能否从这些记录重新做出来?

四个答案都清楚,你拥有的就不只是一段“AI 读稿”,而是一条真正可维护的声音生产线。

来源与修订

完整试听、下载件与开箱资料以 风神播客声音包 为准;近期节目以 风神播客 当前节目库为准。模型和服务的官方入口分别见 Edge TTSLuxTTSQwen3-TTS

本次 v2.1 不生成、不替换、也不发布新的音频;它只把已验证的三档路线、既有试听和已上线节目重新整理成一篇更容易理解和直接复用的文章。声音偏好仍保留给每位听者的人耳判断。

READERS / RESPONSE

读到这里,留一点温度。

觉得有帮助,就送一朵小红花;有自己的经历,也欢迎写在下面。

次阅读 朵小红花 条评论

评论

写下想说的话

0/500

无需登录;评论发布后会公开显示。

还没有评论。欢迎留下第一句。

SOURCES / REVISIONS

来源与修订都留在明处。

小修沿用当前地址;路线被推翻时另开新篇,旧结论不会被静默抹掉。

  1. v2.1

    补入低中高三档的电脑配置与 8GB 边界,并公开从七条路线、百余候选中试错收口的关键弯路。

  2. v2.0

    标题改为 AI 语音合成直达主题;重构为可理解、可试听、可开箱的三档指南,补入风神播客近期生产证据与准确模型身份。

  3. v1.2

    增加固定旧地址与公众号来源识别;原声音、下载和事实口径不变。

  4. v1.1

    纳入连续经验目录,补充长期修订合同。

  5. v1.0

    首次发布三档真实试听、算力对比、安装说明和主播设计提示词。