[オリジナル] 手だけで十分:RVC初心者モデルトレーニングチュートリアル(クラウドチュートリアル)
推論比較
推論後
モデル紹介
frontier
最近、クラスバオ・シャオバイは娘の声をAIで「再現」しました。音声セクションでは、現在人気のAIソフトウェアRVCを使って声を再現・復元しました。さらに、動画サイトの音楽コンテンツクリエイターたちが「AIステファニー・サン」ブームを巻き起こし、全員がAIソフトを使って音声を作成・復元しました。
自分でやってみて
ここでは使
います他のクラウドプラットフォームと比べて、Autodlは多様なグラフィックカードを提供し、通常よりもはるかに安価です。あるいは、トレーニングを避けたい場合は、他の既製の高品質モデルを使うこともできます。ここでは、数千の無料大型モデルを提供し、比較的包括的なモデルサイトであるMiaoyin Workshopをおすすめします Miaoyin-RVC Sound Cloning Workshop。
計算能力を重視するグラフィックスカードを選ぶ際は、比較的手頃な価格と計算能力を提供するため、デフォルトで3080Tiが推奨されます。

コミュニティミラーをRVC-firstを選択し
てくださいV4は40以上のグラフィックカードに推奨され、300以上のカードにはV3が推奨され、他のV1およびV2バージョンには推奨されません。

作成後、コンソールに入り -Jupyterlab をクリックします
。
コンソール内のコード出力
cd /root/Retrieval-based-Voice-Conversion-WebUI && python infer-web.py --port 6006

端末が提供するリンクにアクセスし
ます
詳細な機能説明
モデルの推論

訓練済みモデルの最初のステップは、推論トーンで正しく表示できるようにリフレッシュすることです。男性を女性+12、女性を男性に-12に変換します。その他の設定は上記のように設定できますが、残りはデフォルトで変更しません。設定完了後、変換をクリックします。
伴奏で分かれるボーカル

上記のプロンプトに従ってください。異なるモデルを選ぶ前に、音声に残響があるかどうかに注意してください。


ドライオーディオにはバックグラウンドノイズやノイズ、その他の音が一切含まれてはいけません。上記の設定に従ってください。念のため言っておくと、ラウンド数が多ければ多いほど良いわけではありません。テストしてみましょう。良好なドライ音声品質なら50ラウンド許容範囲です。入力トレーニング音声は最低でも1分は必要で、そうでなければ失敗します。 トレーニング後はウェイトフォルダに保存されます。
モデル融合

簡単に言えば、モデルAとBを融合させて出力モデルCにすることを意味します。ここで重要なポイントはAとBの融合比率です。Aモデルの音色をより多く保持したい場合は、比率を0.5以上に上げることができます。
その他の注記
実はRVCモデルのトレーニング手順はそれほど複雑ではありません。本当の課題は、乾いた音をどう扱うかです。私たちがダウンロードする乾いた音の多くは、背景音を削除しても完璧ではなく、後の推論でさまざまな奇妙な問題を引き起こします。訓練済みの大規模モデルで最も重要なのは、乾いた音の処理です。
苗音モデル
バージョン詳細
推奨パラメータ
関連モデル
キーワード
コメント
コメントはまだありません

![[オリジナル] 手だけで十分:RVC初心者モデルトレーニングチュートリアル(クラウドチュートリアル)](https://apis.klrvc.com/wp-content/uploads/2024/04/WX20240410-102826.png)