search

[オリジナル]RVCファインチューニングボトムモールド - Yue f048K

visibility 1.6kchat_bubble_outline 0favorite 13
更新日: 25/04/30公開日: 25/04/02
[オリジナル]RVCファインチューニングボトムモールド - Yue f048K

推論比較

推論後

0:000:00

モデル紹介

本日、Miaoyinによって微調整された新しいベースモデルをリリースすることをお知らせできることを嬉しく思います。これはRVC2ベースモデルを基にファインチューニングされています。以下は私たちが訓練した言語の一部です。

追加:日本語≈10時間分の高品質音声、複数人話し合いデータセットや一部のアニメデータセットも含まれています。

追加:中国語≈で15時間分の高品質スタジオ音質。

追加:2時間分の中国語歌曲データセット。

現在、バージョン1.0では、これら2つの音声ラインを一時的に追加しています。新たに微調整されたバージョンの下位で訓練されたモデルが良好なレベルに達するかどうかはまだテスト中ですが、データのごく一部だけで推論訓練に成功しています。 これは非常に良いスタートです。

調整モデルのデータが非常に大きかったため、GPUには非常に負荷がかかり、3万ステップしか進めませんでした。

471863056420250402165041

この曲線が理解できない場合は、ユーザーヘルプセクションの過去の記事で詳細な説明を参考にしてください。損失値は常に変動してきました—少なくともGモデルの損失値からは、最小限の訓練では判断できません。しかし、これらの推論モデルをテストした結果、基本モデルがRVC_v2で優れているため、性能は非常に良好でした。

次に、いくつかの音声クリップを使用します(下部モデルが直接推論します。元のデータセットは訓練されていないためです)。 )

オリジナル音声

<!--[if lt IE 9]>document.createElement('audio');<![endif]-->

基本モデル推論

ボトムモデルに元の音声データを加えない場合、ボトムモデルの推論効果は6〜7ポイントの類似点に達することがあります。

次に、第2段落

オリジナル音声

基本モデル推論

注意深く聞くと、元の音声はベースモデルに含まれていませんが、出力音色は非常に似ています。その後の推論モデルのトレーニングでは、ベースモデル+話者(場合によっては一部の話し言葉)+感情的な発言だけで良い推論モデルが得られます。

もちろん、今後もこのモデルは改善していきますし、常設錬金術師はダウンロードして楽しむことを最優先すべきです。

以下に使い方のチュートリアルを示します:

モデルをネイティブRVCプロジェクトに配置する方法:

資産pretrained_v2

DとGから始まる2つのpthファイルをこのフォルダのディレクトリに直接抽出してください。使用名は変更しないでください。

トレーニング中はこれらのパラメータに注意を払う必要があります。

Image [2]-Miaoyin-RVC Tone Model Workshop

目標サンプリングレート+トレブル+バージョンは一貫していなければなりません。ファインチューニングモデルはf048Kでファインチューニングされているため、ここでも一貫性が求められます。

Image[3]-Miaoyin-RVC Tone Model Workshop

モデルパスを変更した後、正しいターゲットサンプリングレートを選択しれば、

Gモデルパス:

assets/pretrained_v2/G_mygfyue48K.pth

Dモデルパス:

assets/pretrained_v2/D_mygfyue48K.pth

トレーニング前に、トレーニングモデルの経過に注意を払ってください。

RVC_V2ベース型と比較していないので、後でさらに詳しくやってみます。

D_mygfyue48K(model_hash):b3640c5ac8fdc81b3934be1173d4f2a6ec2d815742f477632f9a727a442a7034

G_mygfyue48K(model_hash):087e08d6e3992de28deba1cd87c7a56eac5b257b8b72d97c8fc83c94f2a6e99b

その後の計画には、他の声のセリフのさらなる微調整や歌唱部分の調整も含まれます。

 

苗音モデル

苗音モデル

inventory_20person_add0

バージョン詳細

オリジナルいいえ

推奨パラメータ

Threshold0.25
Pitch0
Index Rate0.75
Volume Factor1.25
Sample Length192
Harvest Processes2
Fade Length100
Extra Inference Time500
info参考用です。実際の入力に応じて調整してください!

関連モデル

関連モデルなし

キーワード

#rvc#ダウンロード#無料#苗音工房#膜下#ボトムモデル#ファインチューニング#モデル

コメント

コメントはまだありません