一个人、一块GPU、一肚子对市面上”机器味”合成语音的不满——Fish Audio的故事就是这么开始的。前英伟达研究员Shijia Liao当年觉得市面上的合成声音太假,干脆自己在单卡GPU上训了一个语音生成模型,顺手开源。如今这个叫Fish Speech的仓库在GitHub上攒下超过3.1万颗星,独立开发者、游戏设计师、内容创作者都在用。
这家总部在帕洛阿尔托的公司,本周二宣布拿到5000万美元种子轮融资,由Coreline Ventures和今日资本领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0跟投。对一家种子期公司来说,这个数字不小,但看看它的底子就不奇怪了。

800万用户、2100万美元年收入的”种子期”公司
上线一年多,开源版加托管版的用户超过800万,年度经常性收入做到2100万美元——这份成绩单放在种子轮公司里,相当扎眼。
过去一年Fish Audio发了五个模型:四个语音生成、一个语音转文字。其中三个语音生成模型开源,最新的S2.1 Pro则只走付费API。它的打法很清晰:创作者和小团队买包月套餐,按分钟数生成语音、解锁声音克隆;企业客户走API和平台,HeyGen、Sanas、Plaud这些名字已经在客户名单上了。
CEO兼联合创始人Rissa Cao说,不同客户要的东西完全不一样:HeyGen拿它的声音驱动AI数字人,要的是真实感;游戏工作室给角色配音,要的是表现力;LiveKit这类语音智能体公司做电话场景,要的是自然、低延迟、还得有情绪。Fish Audio靠一个超过1.5万条自然语言控制指令的库,把这些需求都接了下来。
有意思的是,Cao坦承公司原本没打算融资——只做开源加创作者订阅的时候,小日子过得挺高效,根本不缺钱。但要训更强的模型、要接企业大单,加上投资人排着队敲门,这轮融资就水到渠成了。
声音库的另一面:谁的声音,谁说了算
Fish Audio声音库的扩张方式之一,是请用户提交自己的声音用于训练,被采用就给报酬。听起来很社区化,但几个月前出了岔子:有创作者公开指控,自己的声音在不知情的情况下被传到了平台上。当时虽然有DMCA下架流程,但处理速度太慢,惹了不少怨气。
Cao的回应是把下架流程全自动化了:创作者提交一段短语音样本或一纸合同证明声音归属,3分钟内就能从平台下架。不过这依然是”先上车后补票”的逻辑——只要本人没发现,那个声音就会一直在平台上被使用。
- 领投方Coreline Ventures合伙人Oskue Honda把话说得很直:社区驱动模式要成为持久优势,前提是创作者信任平台,同意、透明、署名必须做进产品里,而不是事后打补丁;
- 他还提出行业该走向声音所有权验证、清晰的授权条款、便捷的举报下架机制,最终实现声音被商用时创作者能分钱;
- 359 Capital合伙人Rico Mallozzi则看中性价比:这支团队用远少于大实验室的资源做出了前沿水准的模型,细粒度控制加低成本训练,是它跟巨头掰手腕的本钱。
接下来的路线图也定了:年内发布音频理解模型,语音到语音的模型也在路上。赛道确实拥挤——ElevenLabs、WellSaid、Cartesia、Speechify、Async、Krisp全都盯着创作者和企业的钱包。但一家靠单卡GPU起家、用户破800万、还没花完种子钱的公司,至少证明了这个市场远没到终局。

1.5万条自然语言控制指令这个思路比单纯堆音色聪明,游戏配音和客服电话对声音的要求完全是两码事,能用一套库接住不同场景才是壁垒。倒是好奇它跟ElevenLabs正面碰的时候,价格能压到什么程度。
开源攒口碑再靠API收费,这条路Fish Audio走得挺顺,2100万ARR对种子期来说真不算小。不过声音被人偷传上平台这事,3分钟下架听着快,问题是本人压根不知道被传了才是死结,验证所有权这步不做到上传环节,迟早还得炸一次。