search

Cn_hubert使用說明

visibility 2.4kchat_bubble_outline 0favorite 15
更新於: 26/06/11釋出於: 25/11/29
Cn_hubert使用說明

推理對比

推理後

未提供

模型介紹

近期,我們發現有部分用戶對模型在【咬字】方面的表現提出了反饋。經過多次對比測試與技術分析,我們確認在 Retrieval-based-Voice-Conversion-WebUI 項目中,HuBERT_base 對整體的發音清晰度、咬字準確性以及語音特征抽取,起到了至關重要的作用。

在深度追蹤問題後,我們進一步發現:

  • 不同版本的 HuBERT(如 hubert_base、chinese-hubert、改進自監督版本)在特征提取上的差異,會直接影響模型對輔音/爆破音/弱音的識別。

  • 若底模使用的 HuBERT 權重質量不穩定,可能導致推理階段出現 口胡、吞字、咬字不準、輔音殘缺 等問題。

  • 用戶訓練的數據集質量(清晰度、情緒變化、噪音、斷句)也會被 HuBERT 放大或弱化,從而影響最終的咬字效果。

為此,在前期的實驗中,我們嘗試對 Retrieval-based-Voice-Conversion-WebUI 所使用的 HuBERT_base 進行微調。為了確保之前模型能夠與原有的自監督 HuBERT_base 權重保持兼容,我們特意 凍結了模型的部分前置層,僅對高層進行微調,使其在保留基礎特征的同時適應新的訓練數據。

然而在實際驗證中我們發現:
雖然這種方法在某些場景下帶來了一定的改善,但總體效果依舊不理想。此前所有基於舊特征訓練的模型在推理時普遍出現 咬字混亂、發音漂移、甚至胡言亂語 等現象,影響較為嚴重。

顯然,這次基於層凍結策略的微調並未達到預期目標,也無法滿足用戶對於咬字穩定性的要求。我們已判定該方向為一次失敗的微調嘗試,並基於此經驗調整後續的優化路線。

之後我們不得不改變策略,直接使用chinese-hubert自監督模型來訓練特征模型。

如何判斷您的模型使用的是哪種 HuBERT 自監督模型

在模型詳情頁中,您可以在頂部看到該模型所使用的 HuBERT 類型:

模型詳情頁截圖

詳情頁頂部的模型參數區域會明確顯示:

模型參數截圖

如果這裡顯示為:Cn_hubert,那么您必須按照下方教學進行操作,否則推理時模型將會出現:胡言亂語 / 咬字錯誤 / 發音混亂 等問題。


HuBERT 替換教學(務必仔細閱讀)

請前往 Retrieval-based-Voice-Conversion-WebUI 的安裝目錄,並找到以下文件:

assets/hubert/hubert_base.pt

此文件就是 WebUI 推理時所依賴的 HuBERT 模型。

當使用“Cn_hubert 訓練的模型”進行推理時,必須將此文件替換為我們提供的 Cn_hubert 版本,否則會導致推理異常。


Cn_hubert 下載地址

123 雲盤: https://www.123865.com/s/hufyjv-KphO3?pwd=OLNr

海外直鏈: https://huggingface.co/Rvcmodel/hubert/resolve/main/hubert_base.pt?download=true


替換步驟(請嚴格按順序執行)

  1. 從上方鏈接下載 Cn_hubert 版本的 hubert_base.pt 文件。
  2. 進入您的 RVC WebUI 目錄,找到:
    assets/hubert/hubert_base.pt
  3. 務必先手動備份原文件。
  4. 將下載好的新的 hubert_base.pt 覆蓋原文件。
  5. 重新啟動 WebUI。

由於“二改”版本或其他版本目錄不一致的情況,直接在根目錄下搜尋hubert_base.pt替換也是可以的。


重要註意事項(一定要看!)

① 如果您使用的是 “非 Cn_hubert” 訓練的模型:

如果你用的是En_hubert訓練的模型替換成 Cn_hubert 後,會導致推理出現胡言亂語。

解決方法:換回您備份的原版 hubert_base.pt。

② 如果您使用的是 “Cn_hubert 訓練的模型”:

不替換成 Cn_hubert 版本的 hubert_base.pt,也會出現胡言亂語。

解決方法:安裝我們提供的 Cn_hubert 版本並重新啟動 WebUI。


總結

一句話規則:

  • 用 Cn_hubert 訓練的模型 → 必須使用 Cn_hubert 版本的 hubert_base.pt
  • 用原版 HuBERT 訓練的模型 → 必須使用原版 hubert_base.pt
  • 在換句話說,如果你看到模型參數用的是Cn_hubert你就按照這篇操作文檔替換來即可,如果是En_hubert則不需要更改任何文件,使用原版rvc加載模型即可。

只要 HuBERT 與模型訓練時使用的版本不一致,就會直接導致推理出現發音混亂。

後期

之後,我們將陸續發布一批基於 Cn_hubert 自監督模型 訓練的中文模型,用於改善中文場景下的【咬字】清晰度與穩定性。
需要註意的是:該係列模型主要針對 中文語音特征 優化,因此 無法保證在其他語言中的咬字準確度

未來,我們仍會在大部分模型訓練中繼續采用 Retrieval-based-Voice-Conversion-WebUI 原始的自監督 HuBERT 模型,以確保整體生態的兼容性與跨語言表現的穩定性。

Carrier

Carrier

inventory_20person_add0

版本詳情

是否原創非原創

推薦引數

Threshold0.25
Pitch0
Index Rate0.75
Volume Factor1.25
Sample Length192
Harvest Processes2
Fade Length100
Extra Inference Time500
info僅供參考,請根據實際情況調整!

相關模型

暫無相關模型

模型關鍵詞

#Cn_hubert#rvc#咬字#模型#清晰

使用者評論

暫無評論