Cn_hubert使用說明
近期,我們發現有部分用戶對模型在【咬字】方面的表現提出了反饋...
近期,我們發現有部分用戶對模型在【咬字】方面的表現提出了反饋。經過多次對比測試與技術分析,我們確認在 Retrieval-based-Voice-Conversion-WebUI 項目中, HuBERT_base 對整體的發音清晰度、咬字準確性以及語音特征抽取,起到了至關重要的作用。 在深度追蹤問題後,我們進一步發現: 不同版本的 HuBERT(如 hubert_base、chinese-hubert、改進自監督版本)在特征提取上的差異,會直接影響模型對輔音/爆破音/弱音的識別。 若底模使用的 HuBERT 權重質量不穩定,可能導致推理階段出現 口胡、吞字、咬字不準、輔音殘缺 等問題。 用戶訓練的數據集質量(清晰度、情緒變化、噪音、斷句)也會被 HuBERT 放大或弱化,從而影響最終的咬字效果。 為此,在前期的實驗中,我們嘗試對 Retrieval-based-Voice-Conversion-WebUI 所使用的 HuBERT_base 進行微調。為了確保之前模型能夠與原有的自監督 HuBERT_base 權重保持兼容,我們特意 凍結了模型的部分前置層 ,僅對高層進行微調,使其在保留基礎特征的同時適應新的訓練數據。 然而在實際驗證中我們發現: 雖然這種方法在某些場景下帶來了一定的改善,但總體效果依舊不理想。此前所有基於舊特征訓練的模型在推理時普遍出現 咬字混亂、發音漂移、甚至胡言亂語 等現象,影響較為嚴重。 顯然,這次基於層凍結策略的微調並未達到預期目標,也無法滿足用戶對於咬字穩定性的要求。我們已判定該方向為一次失敗的微調嘗試,並基於此經驗調整後續的優化路線。 之後我們不得不改變策略,直接使用chinese-hubert自監督模型來訓練特征模型。 如何判斷您的模型使用的是哪種 HuBERT 自監督模型 在模型詳情頁中,您可以在頂部看到該模型所使用的 HuBERT 類型: 詳情頁頂部的模型參數區域會明確顯示: 如果這裡顯示為: Cn_hubert ,那么您必須按照下方教學進行操作,否則推理時模型將會出現:胡言亂語 / 咬字錯誤 / 發音混亂 等問題。 HuBERT...
MiaoYin Original Content. Official source: https://klrvc.com. Source: https://klrvc.com/zh-TW/mxgf/3714. Unauthorized scraping, republishing, model data cloning, or commercial redistribution is not permitted.
Cn_hubert, rvc, 咬字, 模型, 清晰
使用幫助



