生成一段一分多钟、带情绪起伏且自然插话的双人广播剧,过去需要分别生成单句再手动拼接,成本动辄数角。开发者 Simon Willison 最近把 Google 最新开放的 Gemini 3.8 Flash TTS 接进前端,生成一段 1 分 18 秒的双人鹈鹕辩论音频,仅耗时 20 秒,账单只扣了 2.74 美分。
Google 突然把生成式语音的底价砸穿到了地表。
Gemini 3.8 Flash TTS 与 Flash-Lite TTS 现已开放。按每秒恒定消耗 25 个音频 token 计算,生成一分钟音频的成本最低压到了 0.009 美元,折算下来一小时只要 0.54 美元。这笔账面开销相当于独立语音龙头 ElevenLabs 商业订阅成本的二十分之一,也比 OpenAI 的 mini-tts 便宜了一半。
但商贾之算往往藏在细则深处。翻开接口文档与技术约束,三道硬伤直接摆在眼前:极低费率只保留到 2026 年底,元旦一过成本立刻翻倍;原生多角色对白被死死卡在单次最多两人;宣称只需 30 秒的声音克隆功能,在欧洲、英国及美国部分州因生物识别法规直接禁运。这场以超低价突袭独立厂商的闪电战,底下垫着相当仓促的工程水分与大厂脚镣。
限时半价的圈地阳谋
为了从 ElevenLabs 和 OpenAI 口中撕开缺口,Google 在费率上采取了极具破坏性的打法。
在 2026 年 12 月 31 日之前的促销窗口期内,Flash-Lite TTS 音频输出单价仅为每百万 token 6 美元(折合每分钟 0.0090 美元),Flash TTS 为每百万 token 9 美元(折合每分钟 0.0135 美元),文本输入均为每百万 token 0.50 美元。横向对照主流方案,OpenAI 的 gpt-4o-mini-tts 音频输出为每百万 token 12 美元,ElevenLabs 订阅折算成本普遍在每分钟 0.10 至 0.20 美元区间。

| 模型与通道 | 促销期输出单价 (至2026年底) | 2027年起常态单价 | 原生多角色上限 | 计费计量单位 |
|---|---|---|---|---|
| Gemini 3.8 Flash-Lite TTS | 约 $0.0090 / 分钟 ($6/M) | 约 $0.0180 / 分钟 ($12/M) | 2 个预置角色 | 音频 Token |
| Gemini 3.8 Flash TTS | 约 $0.0135 / 分钟 ($9/M) | 约 $0.0270 / 分钟 ($18/M) | 2 个预置角色 | 音频 Token |
| OpenAI gpt-4o-mini-tts | 约 $0.0180 / 分钟 ($12/M) | 约 $0.0180 / 分钟 ($12/M) | 仅单角色 | 音频 Token |
| Google Cloud Chirp 3: HD | 约 $0.0500 / 分钟 ($30/M字符) | 约 $0.0500 / 分钟 ($30/M字符) | 仅单角色 | 字符数 |
| ElevenLabs 商业目录 | 约 $0.0500 - $0.1000 / 分钟 | 约 $0.0500 - $0.1000 / 分钟 | 最多 10 角色 (v3) | 字符/订阅配额 |
云厂商从不做赔本买卖。Google 在价格说明底部明确标注,2027 年 1 月 1 日起所有输入与输出费率强制上涨一倍。届时 Flash 输出成本升至每百万 token 18 美元,Flash-Lite 升至 12 美元,文本输入同样从每百万 token 0.50 美元涨至 1.00 美元。
三个多月的半价期正好够出海短剧、独立游戏团队完成原型验证并接入管线。一旦多角色生成脚本、流式对话逻辑和自动化工作流深度绑定在 Gemini API 上,后续迁移技术栈的人力和工程代价,远比翻倍后的账单更沉重。技术选型必须按常态价格核算长期预算,把促销半价当长期成本的企业,年底都会收到现实开出的罚单。
原生对白只给两人,两千音色水分在哪
在交互层面,Gemini 3.8 Flash TTS 确实拿出了区别于传统朗读工具的形态。

开发者可以用自然语言提示词凭空描述人声特质,比如沙哑度或方言口音,还能在单份脚本里调度双人对白,通过提示词直接插入笑声、叹息和呼吸停顿。官方公布的成绩单显示,Flash TTS 在 Hume AI 声音设计榜单拿下 71.4 分登顶,重音建模取得 60.8 分。
但在漂亮的演示背后,有两个刺眼的工程落差。
宣发文案声称拥有超过两千种预设声音,第三方调用界面也抓取到了 2089 个名称。但翻开官方发布说明就会发现,生产环境的声音端点明确标注的只有 150 多种预置与自定义声音。界面中膨胀出来的两千多项,绝大部分是未去重的多语言变体与分类标签映射,并不是真正拥有两千位独立音色的专业声优库。
更致命的是角色容量限制。单次请求最多只支持 2 个预置声音。一旦剧本需要加入第 3 个角色,或者试图把自定义克隆声线放进多角色对白,端到端编排机制立刻失效,开发者必须退回传统的单句调用与音频拼接管线。相比之下,ElevenLabs 的 Eleven v3 单次已能容纳 10 个角色混编。
社区实测中还发现,自回归生成声学 token 时微小误差会在时序中累积。德味英语的长句音频在后半截出现了明显的音色漂移,带有强烈语气指令时更容易用力过猛,导致部分拟音产生尖锐杂音。
严苛的活体双检与六大法域禁运
在声音复刻环节,Google 筑起了一套极其繁琐的合规防线。

开发者上传 10 到 30 秒的参考音频后,必须强制提交发音人朗读官方免责条款的第二段录音。系统交叉核验两段音频声纹确认同一人后才发调用凭据,底层还会打上 SynthID 隐形水印和 C2PA 凭证。此外,克隆声线在云端保存期仅限 1 年,客户端密钥有效期仅 7 天。
比繁琐流程更致命的是地理围栏。受生物特征识别法规限制,AI Studio 中的声音复刻功能在欧洲经济区、英国、瑞士、印度、美国伊利诺伊州及德克萨斯州直接不可用。
海外业务团队若在这些受限法域部署克隆管线,接口会直接报错。大厂筑起这道深沟高垒是为了在诉讼中全身而退,但这套设计把大量希望低门槛复刻声音的出海团队挡在门外。
商业算盘与选型分水岭
语音赛道至此划出了三种截然不同的生存逻辑。
OpenAI 极其保守,把 GPT-4o 语音功能锁死在少数固定预设里,绝不放开克隆接口以防深伪反噬;ElevenLabs 固守专业生产力,用高纯净度、多角色混音与时间线编辑器维持溢价;Google 则是典型的云巨头打法,仗着 130 种语言支持和极低资费,联合 LiveKit、Agora 快速吃下成本敏感型工作流。
天下熙熙皆为利来。这场价格战的分水岭非常清楚:
如果是双人播客、客服问答原型或出海短剧的双角色轮替,利用 2026 年底前这三个多月的半价窗口期,确实能以白菜价跑完冷启动;
但如果业务涉及三人以上多角色广播剧,或者要在欧洲、英国等六大禁运法域做声纹复刻,Gemini 现阶段在工程与法律上都无法交付。低价能把人引进来,却盖不住翻倍后的常态成本与背景底噪,岁末换约之时才是真正的结算时刻。
