🎙 台灣腔語音合成引擎載入中…

完整 API 文件: /docs · /llms.txt

🔑 API 金鑰(伺服器有設 TTS_API_KEY 時才需填)

未填時若伺服器已啟用驗證,呼叫會回 401。

🗣 聲音與文字

🔤 逐字改音:在某個字後面加括號標注音拼音,例 你(ㄋㄧˇ)體(ti3)語(yu3)言(只改括號前一個字;兩種引擎皆適用,拼音需帶聲調 1–5)。

🎭 語氣範例(一鍵套用語氣+示範文字)
🎭 語氣與語速

1=原速,>1 快、<1 慢

0=原音高,每格一個半音

🎚 調音(去回音 / 去爆音)

零樣本聲音會把參考音的空間殘響學進來→聽起來有回音;勾選後在輸出端壓掉回音+毛邊(純後處理、近即時)。想細調展開下方滑桿(動過的滑桿會覆寫一鍵預設)。徹底乾淨要從聲音的參考音重建。

去回音強度;0=不去,0.4–0.6 一般,>0.7 壓很多但會變悶

削嘶聲/毛邊(去爆音感);0.5≈-3dB、1≈-6dB

去低頻 rumble/口爆;0=不切,建議 60–90

@3kHz;+ 更清晰前置、− 更柔

@12kHz 更亮;需搭輸出增強(44.1k)才生效,24k 自動跳過

不勾一鍵、且滑桿沒動過 → 完全不調音(與原本相同)。

⚙ 進階參數(穩定度 / 停頓 / 取樣 / seed)

句末與逗號(。,、!?.)後插靜音,預設 150,150–400 較自然,0=關閉

中文字間空白(轉頓號)處插靜音,預設 100(比標點短),0=不插(仍保留頓號軟停頓)

0=關閉(單次、最快);2–5=同句多次取樣選最乾淨那次,合成時間約 N 倍(易超過 100 秒逾時)

讓 fp32 matmul 走 TF32 tensor core:CosyVoice3 引擎生效、聽感無差、非 bit-identical。模型已 fp16/bf16,加速多半個位數 %,關掉可 A/B 比對速度

🕘 最近合成(存在本機瀏覽器,可一鍵回填參數重生)
🔤 臨時讀音字典(單次有效、不存檔;每行「詞=替換」)
🧩 API 片段(用目前設定產生 curl / Python,可一鍵複製)

  

  
  
  
可調參數說明
參數範圍預設說明
lora_scale0–1留空=checkpoint留空用合併好的最佳版;填值(建議0.2–0.5)改用 adapter 即時調強度。勿填 2.0
temperature0–1.50.8越高越隨機
top_p0–10.85核取樣:只從「累積機率達 top_p」的最可能字裡挑。越小越保守穩定、越大越多樣
top_k1–20030只從「機率最高的 top_k 個字」裡挑。越小越穩、越大越有變化
repetition_penalty>0–21.05重複懲罰,不能是 0
max_new_tokens16–1000010000約 12 token/秒;10000≈14分鐘。長文自動切段,每段各自套此上限
best_of0–50(關閉)同句多次取樣、選頻譜最乾淨(雜訊/破音最少)那次。0/1=單次最快;2–5 合成時間約 N 倍。注意 Cloudflare 100 秒會逾時(524),長文+高 best_of 易超時

超出範圍或無效值會自動改用預設(不會報錯),並顯示在上方狀態列。

上傳一段參考音檔即時克隆音色,不需訓練。5–15 秒乾淨人聲效果最佳。

⬆ 可拖放音檔到此 · 建議 3–15 秒、乾淨單人、≥16kHz;逐字稿須與音檔內容一致。超過 30 秒會自動截斷並重新轉寫逐字稿

🔤 逐字改音:字後加括號標注音拼音,例 你(ㄋㄧˇ)體(ti3)(只改括號前一個字;拼音需帶聲調 1–5)。

💾 另存為預設聲音

克隆滿意後,可把這段參考音+逐字稿存成「預設聲音」,之後直接在上方各分頁的聲音下拉選用(CosyVoice3 零樣本)。須先成功克隆一次才能存。

維護所有聲音的顯示名稱分組標籤(訓練聲音+ICL 預設都可改,只動 metadata 不碰權重)。改 id 會連資料夾與 checkpoint 一起搬。刪除僅開放 ICL 預設(訓練聲音受保護)。

列出該聲音所有訓練版本(各 epoch 的 adapter+合併 final),用同一段文字逐一合成做 A/B 比對,挑出最好聽的 epoch。

提示:「設為預設」(把某 epoch 變成對外正式版)需要重新合併 adapter,屬於另一個動作,目前先做試聽比對。

上傳音檔,用 SenseVoice 辨識成文字(中英台混合 OK)。可選填「目標文字」自動算 CER 字錯誤率,驗證合成有沒有念對。

上傳音檔轉成你要的格式(ffmpeg 引擎、純 CPU 不佔 GPU)。支援 mp3 / m4a / wma / aac / ogg / flac / wav 互轉,影片(wmv / mp4)會自動抽音軌。

上傳多個音檔合併成一個(ffmpeg、純 CPU 不佔 GPU)。串接=首尾相接(依選取順序);混音=疊加同時播放(如人聲+配樂)。不同格式/取樣率會自動統一。

上傳一首歌或含背景音樂的音檔,用 demucs(htdemucs) 分離出人聲伴奏,或拆成 vocals / drums / bass / other 四軌。可拿乾淨人聲當零樣本克隆的參考音。GPU 較快(與合成共用、會排隊);CPU 不佔 GPU 但長音檔可能數分鐘。

地端音樂生成(ACE-Step):BGM=純器樂配樂/jingle;歌曲=歌詞→含人聲整首歌(支援中文);風格轉換=上傳一段音樂當底、生成同風格新曲;翻唱=把歌裡的人聲換成本服務的克隆聲音(需該聲音已訓練 RVC 模型)。生成需 30 秒~數分鐘,送出後在下方任務列表輪詢,完成即可試聽/下載。

👆 點範例一鍵帶入(歌曲模式連歌詞、建議長度一起帶),帶入後可自行修改再送出;🎲 讓系統幫你挑。

⚙ 進階選項(不填也能用;想微調再展開)
快速=互動試聽;精緻與快速同為 2B、VRAM 相近只是較慢,一般成品用它;最高=4B 音質最好但 ~9GB,建議先按「釋放 GPU」再獨佔跑。

在單一音檔內剪輯:載入音檔 → 波形上框選(修剪/裁切)或放分割點(分割/重組)→ 匯出。波形與試聽純前端、零相依;實際切片串接由伺服器 /v1/edit(ffmpeg、純 CPU 不佔 GPU)。跨多個檔案拼接請用「聲音合併」分頁。

在波形上按住拖曳框選一段,再選「只保留選取」或「刪除選取」(可重複多次累積裁切)。「去靜音」自動保留語音、剔除開頭結尾與長停頓。

多角色對話一次合成、串接成單一音檔。腳本每行一句:角色:台詞(全形或半形冒號皆可)。輸入腳本後會自動列出角色並各配一個聲音,依需要調整後直接「生成 podcast」。文字自動套台灣繁體發音修正。

節奏=速率/停頓;與「語氣預設」正交(語氣=風格)

保音高(CV3 原生變速);建議 0.85–1.15,1=原速

0=原音高;每格一個半音

標準=每段取樣 3 次選最乾淨+flow 35 步(雜音明顯較少);高品質再加整集輸出增強。試稿用快速。

編輯台灣腔發音修正表,存檔即時生效並寫入伺服器設定檔。整詞替換=整個詞換成想要的字(如 軟體→软体Qwen→阿里千問喔喔→喔)。建議優先用「漢字」填替換值(含同音字,如 哇音不對→哇賽→襪賽),交給模型自家發音、咬字與時長最自然;只有「沒有漢字能表達的台灣特殊音」才退而用拼音(前後保留空格,如 角色→ jiao3 se4 ,零聲母/介音音節較易咬字不乾淨)。多音字台灣讀音=某字只在 g2pW 判定為台灣特有讀音時才強制該拼音(逗號可填多個)。填完用上方「即時測試」確認送進模型的版本,再按存檔。

整詞替換

原文替換成

多音字台灣讀音

台灣音(逗號分隔,如 wei2)

貼入一段文章,逐句合成 → ASR 辨識 → 自動比對,找出念歪的字(聽起來像別的字,如 顯→眼)。每字附同音字 / 簡體修正建議,聽過音檔確認後一鍵加入發音修正表。專抓「念成完全不同的字」;聲調差異 ASR 抓不到、仍需耳聽。

目前 GPU 合成佇列(每 1.5 秒自動刷新)。單張 GPU 一次只跑一筆,其餘排隊。排隊中取消=完全跳過、不耗 GPU;合成中取消=在下一個分段邊界(best_of 取樣間 / podcast 逐句間)停,單句一次合成無法即時中斷,會等該句跑完。

類型聲音文字狀態取樣時間

過往完成的合成/音樂任務與各自耗時(持久紀錄,服務重啟不消失;新→舊)。用來回答「之前那次生成花了多久」。best_of 取樣數會直接乘上生成時間——podcast 逐句取樣 N 次是變慢的主因。

完成時刻類型聲音文字取樣耗時狀態

⌨ 鍵盤快捷鍵

Ctrl+Enter合成目前分頁
Esc取消進行中的合成 / 關閉此視窗
Ctrl+19切換分頁
Space播放 / 暫停最近的音檔
?顯示 / 隱藏此速查表

在輸入框內打字時快捷鍵不會觸發。點空白處關閉。