EPISODE · Jul 29, 2026 · 2 MIN
Fish Audio 推出 S2.1 Pro 模型,只要上傳五秒音檔就能複製聲線
from EasyVibeCoding Podcast · host Fish Audio
Fish Audio 推出 S2.1 Pro 模型,只要上傳五秒音檔就能複製聲線。 融資與業務里程碑 Fish Audio 於 2026 年 7 月 29 日宣布完成 5200 萬美元的種子輪融資,同時宣布 S2.1 Pro 正式公開推出。官方指出,團隊在短短一年內從一個開源專案成長為達到 2100 萬美元 ARR(年度經常性收入)的規模。目前其模型已被 HeyGen、LiveKit、Retell、Sanas 與 OpenArt 等前沿 AI 企業在生產環境中實際採用。為慶祝成立一週年,官方推出互動優惠活動,使用者只要在社群平台按讚、轉發並留言「Fish」,即可獲得一個月的 S2.1 Pro 免費使用權限。 展示十三位不同背景與組織成員大頭照的陣容列表,每位下方皆附有姓名與所屬公司名稱。 核心效能與成本優勢 根據官方與展示影片( 一名講者在筆電前展示 Fish Audio S2.1 Pro 的即時語音複製與多語系對話展示 )資料,S2.1 Pro 在語音合成效能與經濟成本上具備顯著優勢: 僅需 5 秒的音訊樣本即可完成聲音複製。 運作速度是 Cartesia 的兩倍,成本則僅為 ElevenLabs 的六分之一(影片顯示每 100 萬字為 15 美元,相比 ElevenLabs 的 100 美元與 Cartesia 的 45 美元更具競爭力)。 提供具備單字層級(word level)控制能力的表達力,使用者能精細調整情緒、語調與語速等細節。 官方承諾若企業客戶改用其語音 AI 方案無法節省超過 50% 的成本,將提供一年的 Fish Audio 免費使用服務,預約展示可透過 S2.1 Pro 預約連結進行。 展示與基準測試表現 在官方展示影片中,S2.1 Pro 展現了即時語音複製與多語系對話能力,並在 Coval AI TTS 基準測試中達到 240 毫秒(ms)的首個音訊延遲(TTFA),落在「FAST & ACCURATE」區域。影片與展示畫面也揭露了以下累積數據與功能標籤: 累積呼叫次數突破 1 億次(100M+ calls),語音處理時數超過 1000 萬小時。 支援多語系(Multilingual)、表達模式(Expressive Mode)、多發話者理解(Multi-Speaker Understanding)以及人名發音(Name Pronunciation)等功能。 具有流線型光影與紅、橘、紫漸層的抽象背景圖像 一名講者在筆電前展示 Fish Audio S2.1 Pro 的即時語音複製與多語系對話展示 影片中的 Prompt 與操作: 操作步驟: 1. OGFRAME: 00:23 原文:https://easyvibecoding.app/curated/2761-fish-audio-launches-s2-1-pro-voice-cloning-model
Embed this episode
Ready to play
Fish Audio 推出 S2.1 Pro 模型,只要上傳五秒音檔就能複製聲線
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.