RVCの使用チュートリアル(WEB_UI推論バージョン)
推論比較
推論後
モデル紹介
これはRVCを初めて使った人のために書かれています。最近、多くの初心者がRVCを始めたばかりで、正しい使い方がわかっていません。このチュートリアルは、最も簡単で分かりやすい方法で教えてくれます。
構成
| プロジェクト | は最低点で実行可能です | |
|---|---|---|
| graphics card | GTX 1060 6 G以上 NVIDIAカード | RTX 3060 12 G |
| CPU | 4 cores 8 threads | 第10世代i5 / R5-5600以上 |
| memory | 8 GB | 16 GB |
| system | Win10/11 64-bit | 上記と同じ |
ダウンロード
ネットワークが良好であれば、Githubから統合パッケージを直接ダウンロードできます。当社のすべてのモデルはバージョン2.2.231006に基づいて訓練されています。
|
|
RVC国内の高速ダウンロード直接リンク |
|
旧バージョンおよび非50シリーズNカード |
https://www.modelscope.cn/models/FlowerCry/rvc-windows-packages/resolve/master/RVC20231006Nvidia.7z |
|
旧バージョン & A card I card |
|
|
新バージョンおよび非50シリーズNカード |
https://www.modelscope.cn/models/FlowerCry/rvc-windows-packages/resolve/master/RVC20240604Nvidia.7z |
|
新バージョンおよび50枚のシリーズNカード |
|
|
new version & A card i card |
ダウンロード後、直接解凍してください。
その中で、プロジェクトのルートディレクトリにある2つのファイルだけに注目すればよくなります。
go-realtime-gui.bat(リアルタイム音声切り替えクライアント
)。go-web.bat(RVC_Web)
両者の違いは、前者はサウンドカードのジャンパー(バーチャルサウンドカード)だけでリアルタイムでトーンを切り替えられる点です。 後者は音声推論やモデルトレーニングを行うことができます。
モデルトレーニングやリアルタイムの声変換クライアントについてはここでは説明しません。モデルは上記のチュートリアルにリンクされています。興味があれば、「初心者から熟練者まで」というチュートリアルをチェックしてみてください。
ここでは主に音声推論(主にAIカバーやファン作品など)にRVC_webを使う方法をお教えします。
理由
go-web.bat、ダブルクリックでファイルを開くと、コンソールが以下の情報を出力します。
\RVC1006Nvidia>runtime\python.exe infer-web.py --pycmd runtime\python.exe --port 6968 デフォルトのポートは6969です。他のポートとの競合があるので、6968に変更しました。もし警告ポートの競合が発生した場合は、 go-web.batで新しいポートを編集して、もう一度実行すればいいだけです。
2025-09-21 13:55:10 | 情報 | configs.config | NVIDIA GeForce RTX 4090 GPU を見つけました。こちらがあなたのGPU情報です。もし利用できない場合は、対応する統合パッケージのバージョンを選択していないため、特定できない可能性があります。
is_half: 本当です。device:cuda:0 上記と同じ
2025-09-21 13:55:14 | 情報 | __main__ | 言語を使う:デフォルトの言語zh_CN。
ローカルURLで動作中:http://0.0.0.0:6968
その後、ウェブページが表示されます(一部のパソコンでは表示できない場合がありますので、ブラウザで入力してください)。http://127.0.0.1:6969 します。 基本的に、ここの環境は問題ありません。 問題があれば、その問題に基づいて解決策を探すかもしれません。
—補足——-
一部のユーザーはこのウェブページのステップがまだ表示されていないため、コントロール画面で止まっています。 解決策:コンソールでEnterキーを押すだけです。
![Image [1]-Miaoyin-RVC Tone Model Workshop](https://apis.klrvc.com/wp-content/uploads/2025/09/d3c27345de20250921140455-1024x565.png)
これは重要です:推論のモデルを得るには、まずモデルを入れてください。
RVC1006Nvidia\assets\weights
今後ダウンロードされるすべての RVC モデルに pth サフィックスが付いている場合は、必ずこのフォルダに入れてください。
その後、トーンリストとインデックスパスを更新し、入力したモデルまでスクロールします。
インデックス拡張子については、好きな場所に配置でき、次に[feature search libraryファイルパスを埋めます。空の場合はドロップダウン選択結果を使用してください]それだけです。
ピッチサンディ:モデルが発信源が女性の声で、あなたが男性の声だと言ったとします。ここに数字の12を入力するか、似ていると思う音程値を入力できます。 逆に、モデルが男性音声源だと示すなら、数値は-12であるべきです。 実際の状況に応じて数値も入力されます。 ダウンロードしたモデルとプレビューするモデルはしばしば異なる音を出します。これは説明が必要です。すべての音声ソースが異なるため、類似度は通常70〜80%程度です。例えば、AとBの両方を使うモデルはトーンに多少の違いがあります。 ここでは、自分に最も適した音色のサンディに合わせて位置を調整できます。
処理するオーディオファイルのパスを入力します(デフォルトのフォーマットが正しい例です):クリーンな音声ソースを塗りつぶすと、モデルはソースや曲の内容を出力します。
主なポイント
入力音源をきれいに保ち、必ずきれいにしてください。ボーカル分離を理解し、ボーカル出力を別々に抽出・出力する必要があります。現在、[Jianying - 有料]と[UVR5 - オープンソースフリー]の両方でボーカル分離が可能です。UVR5に馴染みがなければ、オンラインで調べるチュートリアルがたくさんあります。
呼吸保護:時には吐息に断裂的な電流が流れることがあります。保護音や呼吸音を下げて、呼吸の涙を感じなくなるまで続けます。
独特な音色にはピッチサンディの柔軟な使い方に特別な注意が必要です。例えば、ショタトーンは明らかに小さな男の子の声ですが、ピッチを0に設定しているのに、なぜ期待に応えられないのでしょうか? ほとんどの「ショタ」トーンは女の子が作り出しており、ピッチサンディは実際の状況に応じて調整する必要があります。おおよそ8度から12度の間で。要するに、柔軟に、そしてピッチサンディの観点から使う必要があります。
もう一つはモデル言語です。モデル言語タグが日本語の場合、モデルは日本語の曲しか推定できません。もちろん他の声も推薦できますが、うまく機能しない場合は「おさの音」が表示されます。
web_uiの他の理由はあまり強調できません。ほとんどはシンプルです。一度か二度通せば、自分だけの「ファン作品」を作ることができます。
苗音モデル
バージョン詳細
推奨パラメータ
関連モデル
キーワード
コメント
コメントはまだありません

