search

[原創]RVC微調底模-悅 f048K

visibility 1.6kchat_bubble_outline 0favorite 13
更新於: 25/04/30釋出於: 25/04/02
[原創]RVC微調底模-悅 f048K

推理對比

推理後

0:000:00

模型介紹

很高興,今天我們發布妙音微調後的新基礎模型,該模型是在RVC2的基礎模型上微調的,下面是訓練的部分語言介紹時長。

新增:日語≈10小時高質量語音包括多人說話數據集以及部分動漫數據集。

新增:中文≈15小時高質量錄音棚音質。

新增:2小時中文歌曲數據集。

目前在1.0中我們暫時新增了這兩種語音,至於新微調的底部訓練出的模型質量是否能達到比較好的一個水平,我們正在測試當中,但目前我們已經實現用很少部分的數據能成功訓練出一個推理模型。這個一個很不錯的開始。

由於微調的模型數據比較大,這對於我們GPU特別緊張的情況下,我們只step了30000步。

471863056420250402165041

這張曲線如果看不懂的話,可以在使用幫助中查看我們之前寫的一篇文章有詳細說明,我們的損失值一直都是跌宕起伏至少看G模型的損失值是這樣的,我無法通過少量的訓練去判斷,但目前在測試這几個推理模型下來,表現還是挺好的,畢竟在RVC_v2中,底模就很優秀。

下面我將會用几段音頻(底部模型直接推理,原數據集未訓練。)

原音頻

底部模型推理

在未給底部模型加入原音頻數據情況下,底部模型的推理效果也能達到6-7分相似。

接下來第二段

原音頻

底部模型推理

如果你仔細听,這些原音頻雖然未在底部模型中,但是輸出的音色卻是非常的相似,在後續的推理模型訓練中,只需要使用我們的底模+說話人(可能少部分的說話)+情緒語句,即可得到一個很好的推理模型。

當然後續我們將會繼續完善該模型,當然永久煉丹師優先下載享用。

下面是使用教學:

將模型放入原生RVC項目中:

assets\pretrained_v2

直接將D以及G開頭的兩個pth文件解壓到本文件夾目錄下,請勿更改使用名稱。

需要註意在訓練當中的這几個參數。

圖片[2]-妙音-RVC音色模型工坊

目標采樣率+高音+版本必須保持一致,因為我們的微調模型是在f048K下微調,所以這裡一定要保持一致。

圖片[3]-妙音-RVC音色模型工坊

之後修改模型路徑如果你目標采樣率選擇正確後你只需要

G模型路徑:

assets/pretrained_v2/G_mygfyue48K.pth

D模型路徑:

assets/pretrained_v2/D_mygfyue48K.pth

在訓練前請註意訓練模型的路徑。

由於我們沒有與RVC_V2的底模有過進行對比,這個將會在後期空閒時間進行比對。

D_mygfyue48K(model_hash):b3640c5ac8fdc81b3934be1173d4f2a6ec2d815742f477632f9a727a442a7034

G_mygfyue48K(model_hash):087e08d6e3992de28deba1cd87c7a56eac5b257b8b72d97c8fc83c94f2a6e99b

後續計劃,繼續微調其他語音,對唱歌部分進行微調。

 

妙音模型

妙音模型

inventory_20person_add0

版本詳情

是否原創非原創

推薦引數

Threshold0.25
Pitch0
Index Rate0.75
Volume Factor1.25
Sample Length192
Harvest Processes2
Fade Length100
Extra Inference Time500
info僅供參考,請根據實際情況調整!

相關模型

暫無相關模型

模型關鍵詞

#rvc#下載#免費#妙音工坊#底膜#底部模型#微調#模型

使用者評論

暫無評論