VoiceDatasetMaker — 動画から「声だけ」を自動で切り出すツール(TTS学習データセット作成等)
- Digital500 JPY


# VoiceDatasetMaker — 動画から「声だけ」を自動で切り出すツール(TTS学習データセット作成等) 動画・音声ファイルをドラッグ&ドロップするだけで、 **BGM・エコー・ノイズをAIで除去し、無音で区切った小分けWAV**を書き出すWindowsアプリです。 音声合成(TTS)の学習用データセット作成を想定して設計しています。 現行版: **v1.1.6**(2026-09-22) ### こんな方に - 自分の配信アーカイブや録音から、TTS学習用の音声データを作りたい - BGM付きの動画しか手元にないが、声だけのクリーンな音声がほしい - 大量の動画を放り込んで自動で処理したい - 数時間の長時間アーカイブをそのまま処理したい ### 主な機能 - **BGM・伴奏除去** — Mel-Band RoFormerによる高品質なボーカル抽出 - **エコー/リバーブ除去・ノイズ除去** — 素材に合わせて個別ON/OFF可能 - **無音で自動分割** — AI発話検出(VAD)で発話区間を検出し、指定した長さ (既定2〜12秒)に収まるよう自動で結合・分割 - **話者フィルタ** — 参照音声を登録すると「その人の声」だけを採用し、 BGMの歌声や読み上げソフトの声などを自動で除外(除外分も別フォルダに保存) 上記の画像の通り、複数参考にする音声を選べ、ピック精度に貢献します。 - **長時間素材に対応** — 内部で10分ずつ区切って処理するため、素材が何時間でも メモリ使用量は一定です。区切る位置は無音へ自動で寄せるので発話の途中で切れません - **低音ノイズの除去** — 声より下の帯域(70Hz未満)にあるうなりを取り除きます - フォルダごとのドラッグ&ドロップ、複数ファイルのキュー処理に対応 - 出力: WAV(モノラル16bit、サンプルレート選択可) 処理時間の目安は**素材1分あたり約11秒**です(RTX 4060 Ti、3つの除去すべてON)。 1時間の素材で約11分、6時間の素材で約1時間強が目安です。 ### 動作環境(購入前に必ずご確認ください) - **Windows 10 / 11 (64bit)** - **NVIDIA製GPU(実質必須)** — CPUのみでも動作しますが処理が数十倍遅くなり、 実用的ではありません - メモリ16GB以上を推奨 - 空きディスク約6GB - ffmpeg(無料。導入手順は同梱の使い方に記載、コマンド1行です) - インターネット接続(初回セットアップとAIモデルの自動ダウンロードに必要) - **Pythonのインストールは不要です**(実行環境同梱) ### セットアップ(3ステップ) 1. zipをすべて展開する 2. `setup.bat` をダブルクリック(必要なライブラリを自動インストール、10分程度) 3. `VoiceDatasetMaker.bat` で起動 初めて「開始」を押したときに、AIモデル(約1.4GB)が自動でダウンロードされます。 ### 内容物 - アプリ本体(Python実行環境同梱) - セットアップスクリプト - 使い方.txt(導入・使い方・細かい調整・トラブルシューティング) - 利用規約(EULA.txt) ### 重要な注意事項 - 本ソフトウェアで処理する音声は、**ご自身の音声、または権利者から許諾を得た音声のみ** にご利用ください。第三者の声の無断収集・学習は、権利侵害や各プラットフォームの 規約違反となるおそれがあります。 - **BGMに歌声が入っている場合、歌声は除去されません。** 本ソフトは「人の声」を 抜き出すAIモデルを使っているため、伴奏(ドラム・ベース・ギター等)は消えますが 歌声は声として残ります。歌声を除きたい場合は話者フィルタをご利用ください。 - AIモデルは第三者の配布物を初回に自動ダウンロードして利用します。配布元の都合により 将来利用できなくなる可能性があります。 - デジタル商品の性質上、**購入後の返金は原則お受けできません**。動作環境を必ずご確認の上 お求めください。 - 詳細は同梱の利用規約(EULA.txt)をご確認ください。 ### クレジット 本アプリは以下のオープンソースソフトウェア・モデルを利用しています。 Ultimate Vocal Remover (UVR)とその開発者の皆さま / python-audio-separator / Mel-Band RoFormer Vocals by becruily / UVR-DeEcho-DeReverb, UVR-DeNoise by FoxJoy / Silero VAD / SpeechBrain / CustomTkinter / PyTorch / SciPy --- ## 【お詫び】旧バージョンの不具合について 以前に配布したファイルに2つの不具合があり、ご購入いただいた方にご迷惑を おかけしました。大変申し訳ありませんでした。 **いずれも現行版 v1.1.6 で修正済みです。** **すでにご購入済みの方は、本ページから v1.1.6 を再ダウンロードしてください。 追加の費用はかかりません。** **1. v1.0 が Windows 標準の機能で展開できなかった問題** v1.0 の配布ファイルは、拡張子が .zip でありながら中身が別の形式になっており、 Windows標準の展開機能(右クリック→「すべて展開」)では中身を取り出せませんでした。 エラーも表示されず、空のフォルダができるだけという分かりにくい状態でした。 「展開したのに何も入っていない」とお困りだった方には、重ねてお詫びいたします。 v1.1.6 は通常のzip形式です。そのまま展開できます。 (お手元の v1.0 のファイルは 7-Zip 等の解凍ソフトでも展開できますが、下記2の 不具合があるため v1.1.6 の再ダウンロードをおすすめします) **2. v1.1 が新規インストールで起動できなかった問題** v1.1 をセットアップして処理を開始すると `ModuleNotFoundError: No module named 'onnxruntime'` というエラーが出て 処理できませんでした。当方の依存ライブラリの指定漏れが原因です。 v1.1.6 では修正済みで、何もない環境からのセットアップを実機で検証しています。 ご不明な点はBOOTHのメッセージ機能からお気軽にお問い合わせください。 --- ### 更新履歴 **v1.1.6 (2026-09-22) — 現行版** - メモリの少ないPCで、長い素材の処理中に「Unable to allocate ...」という メモリ不足のエラーが出て止まる問題に対応しました。空いているメモリの量に 合わせて、一度に処理する長さを自動で調整します **v1.1.5 (2026-09-22) 機能の追加・改善 - **数時間の長い素材に対応** — 内部で10分ずつ区切って処理するため、素材が 何時間でもメモリ使用量は一定です。従来は1時間半あたりでメモリを使い切り、 処理が進まなくなっていました - **処理を約15%高速化** — 30分の素材で390秒 → 329秒 - **低音ノイズの除去を追加** — 声より下の帯域(70Hz未満)にあるうなりを取り除きます - **音量の揃え方を選べるようにしました** — 既定は従来と同じピーク基準です。 ファイル間の聴感音量をより揃えたい場合は、config.json で発話区間の音量基準に 切り替えられます - **初回のモデルダウンロードに進捗表示を追加** — 以前は約1.4GBのダウンロード中に ログが何も動かず、固まったように見えていました。ダウンロード中でも「中止」が 効くようになり、モデルを手動で取得する手順も同梱の使い方に追記しました 不具合の修正 - ダウンロードが途中で切れると、中途半端なファイルが残ったまま「取得済み」と 判断され、以後ずっと失敗し続ける状態になっていた問題を修正 - 「参照した声だけ残す」をONにして長い素材を処理すると、2ブロック目以降で 「RecursionError: maximum recursion depth exceeded」が出て処理できなくなる ことがある問題を修正(使用ライブラリ側の不具合を回避) - アプリを2つ起動したとき、後から起動した方が先に動いている方の処理を 壊してしまう問題を修正 - 配布ファイルの形式と、依存ライブラリの指定漏れを修正(上記お詫び参照) - エラー時に原因の詳細がログに表示されるようになりました - 動作に影響のない警告がログに出ていたのを抑制 ※ v1.1〜v1.1.4 は同日中の暫定版で、内容はすべて v1.1.6 に含まれています。 **v1.0.0 (2026-07-18)** — 初回リリース


