Google新语音模型能从零构建声音
Google推出了Gemini 3.8 TTS语音合成模型,能从文字提示词中生成全新声音,不再局限于几十种预设音色库。从30种音色到无限可能的转变,正在重塑配音、游戏和内容创作的经济逻辑——它先在日本文媒上线,比大多数西方报道更早。
Google刚刚赋予了创作者凭空造声的能力
Google于9月23日宣布推出Gemini 3.8 Flash TTS及其轻量版Gemini 3.8 Flash-Lite TTS。该消息率先在日本媒体亮相——这一细节很重要,因为涌入西方媒体的报道浪潮尚未消化这些模型究竟如何改变了声音的生成、采购与使用方式。
简短来说:Google现在可以通过自然语言提示合成声音,而非从菜单中挑选。而更深远的产业影响,则需要细细展开。
从30种预设到无限可能
此前的Gemini TTS模型,包括3.1 Flash TTS版本,仅限约30种声音类型。这对基础的无障碍工具和简单旁白来说尚可。但对于任何追求角色个性或叙事深度的项目而言,这显然成了瓶颈。
Gemini 3.8 Flash TTS打破了这一上限。你可以描述一种声音——喷火的龙息、带有独特地域魅力的叙述者、在不同场景间变换语调的角色——模型便会据此生成。提示词可以指定角色、口音、发声特征以及区域口音变化。模型支持超过100种语言与方言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
Google同时还推出了一份包含2000多种预制声音的库,但真正的看点在于"声音设计"功能,让创作者能够从零开始打造声音。生成的声音可以保存并在多个项目中重复使用,即便在有声书或播客系列等长篇内容中也能保持一致性。
两款模型,两种定位
Google将产品分为两个层级,对应的正是两类截然不同的用户群体。
Gemini 3.8 Flash TTS面向重度制作场景:游戏开发、有声书演播、播客制作以及互动媒体。它支持细粒度的表演指导——你可以逐行编写舞台指示,用<laughs>和<gasp>等标签插入笑声、叹息等非言语发声,并从一个剧本中构建多角色对话场景。该模型能够在长输出中保持稳定音质与节奏,避免了早期TTS系统常见的说话人漂移问题。
Gemini 3.8 Flash-Lite TTS则侧重于规模与成本效率。配音工作室、语音代理平台,以及任何需要以低边际成本处理海量音频的运营,会发现这是更务实的选择。它以一定的表现力换取速度和经济性。
两款模型均基于Gemini Pro 3.8构建,接受8K token的文本输入,可生成最多64K token的音频输出。知识截止日期为2025年1月。
基准测试揭示趋势
在Hume AI的声音设计基准测试中,Gemini 3.8 Flash TTS以71.4的总分位居第一,并在口音复现项目上以60.8分再度夺冠。Flash-Lite变体则在综合质量评分中位列第二。Google表示,在Voice Arena测试的盲评中,模型在日本语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言上均位居前列——而这些语言长期以来是西方TTS系统的服务盲区。
这一点并非偶然。大多数英语媒体对AI语音工具的报道聚焦于美式和英式口音。Google针对这些语言进行基准测试和优化,表明其瞄准的是本土内容创作正在加速增长、且以英语为先的工具留下空白的市场。
对配音行业意味着什么
配音是全球内容分发中最古老也最昂贵的瓶颈之一。一部动画电影可能需要20到30种语言版本,每一版都需要选角、录音棚录制、导演指导和后期制作。AI语音合成已接近可用质量多年,但始终要么平直呆板,要么像某个已知声音的略微走调翻版。
通过提示词生成一个全新的声音——并能锁定该声音在整个项目中反复使用——大幅削减了这部分成本结构。一个工作室可以为配音全阵容生成一套独特的声音,而无需为每个语言版本聘请配音演员。Google内置的同意的克隆保障机制(要求录制同意声明,且生成声音必须与参考声音匹配)不会消除对真人演员的需求,但会将后者的角色大幅缩减至配角、非对白旁白以及预算紧张的区域配音。
Flash-Lite模型才是真正改变经济账的那款。以更低的单token成本,它让为过去不值得投入的语言进行配音变得可行——而这正是Google通过多语言基准重点瞄准的市场。
游戏和互动媒体是首要受益者
游戏厂商多年来一直受限于同样的30种声音上限。每个NPC、每个任务发布者、每个店主都必须从少量预设中借用声音,玩家早就注意到了。Gemini 3.8 Flash TTS扭转了这一局面。开发者可以描述一个嗓音沙哑的酒馆老板——带有海岸地区的韵律和轻微口吃——生成该声音、保存它,并在数千行对话中一致使用而不会出现漂移。
表演指导功能——逐行舞台指示、嵌入式非言语音效、自然istic的插入语——让TTS更接近配音导演在后期制作中真正可用的工具。这对于依赖电影化叙事的遊戲而言,是一个有意义的重要差距弥补。
访问控制之问
Google内置了多重保障:语音克隆需要同意录音,所有生成音频均带有SynthID水印及C2PA来源元数据。这些都是有意义的保护措施,但同时也提醒我们,技术已跑在了法律框架的前面。同意机制对那些能够录制声明的个体奏效,却无法轻松扩展到 legacy 配音演员——他们的作品正在被复刻,或是扩展到那些由已难以联系到的表演者确立声音的虚构角色身上。
行业需要厘清:基于提示词的声音生成工具,在法律意义上是否构成"使用某人的声音"——而Google的同意要求表明,即便答案尚未尘埃落定,公司也在思考这一问题。
可用性与时间线
这两款模型现已通过Gemini API和Google AI Studio向开发者开放。AI Studio配备了语音制作沙盒,支持双人剧本编辑器和逐行指导控制。通过Gemini Enterprise的企业API访问即将推出。普通用户将在Gemini Notebook中使用Flash TTS,在Google Vids中使用Flash-Lite。
这是一次渐进式发布,而非爆炸式推出。这是刻意的——Google希望给创作者和工作室时间先行实验,再让更广泛的市场调整对AI语音能力的预期。
真正的变革
Gemini 3.8 TTS最重要的意义,不在于声音比之前的模型更好听。而在于它首次在生产级规模上将声音与配音演员脱钩。你不再需要从目录中寻找合适的声音——你描述它、生成它,并为项目拥有它。
这改变了谁能制作音频内容、哪些语言得到服务,以及一件成品要花多少钱。率先摸清这套逻辑的公司与创作者,以及尚未跟上的人,很快就会看到差距。