VoiceDatasetMaker — 動画から「声だけ」を自動で切り出すツール(TTS学習データセット作成等)
- ダウンロード商品¥ 500


VoiceDatasetMaker — 動画から「声だけ」を自動で切り出すツール(TTS学習データセット作成等) 動画・音声ファイルをドラッグ&ドロップするだけで、 **BGM・エコー・ノイズをAIで除去し、無音で区切った小分けWAV**を書き出すWindowsアプリです。 音声合成(TTS)の学習用データセット作成を想定して設計しています。 ### こんな方に - 自分の配信アーカイブや録音から、TTS学習用の音声データを作りたい - BGM付きの動画しか手元にないが、声だけのクリーンな音声がほしい - 大量の動画を放り込んで自動で処理したい ### 主な機能 - **BGM・伴奏除去** — Mel-Band RoFormerによる高品質なボーカル抽出 - **エコー/リバーブ除去・ノイズ除去** — 素材に合わせて個別ON/OFF可能 - **無音で自動分割** — AI発話検出(VAD)で発話区間を検出し、指定した長さ (既定2〜12秒)に収まるよう自動で結合・分割 - **話者フィルタ** — 参照音声を登録すると「その人の声」だけを採用し、 BGMの歌声や読み上げソフトの声などを自動で除外(除外分も別フォルダに保存) - フォルダごとのドラッグ&ドロップ、複数ファイルのキュー処理に対応 - 出力: WAV(モノラル16bit、サンプルレート選択可) ### 動作環境(購入前に必ずご確認ください) - **Windows 10 / 11 (64bit)** - **NVIDIA製GPU(実質必須)** — CPUのみでも動作しますが処理が数十倍遅くなり、 実用的ではありません - 空きディスク約6GB - ffmpeg(無料。導入手順は同梱READMEに記載、コマンド1行です) - インターネット接続(初回セットアップとAIモデルの自動ダウンロードに必要) - **Pythonのインストールは不要です**(実行環境同梱) ### セットアップ(3ステップ) 1. zipを展開 2. `setup.bat` をダブルクリック(必要なライブラリを自動インストール、10分程度) 3. `VoiceDatasetMaker.bat` で起動 ### 内容物 - アプリ本体(Python実行環境同梱) - セットアップスクリプト - README(導入・使い方・トラブルシューティング) - 利用規約(EULA) ### 重要な注意事項 - 本ソフトウェアで処理する音声は、**ご自身の音声、または権利者から許諾を得た音声のみ** にご利用ください。第三者の声の無断収集・学習は、権利侵害や各プラットフォームの 規約違反となるおそれがあります。 - AIモデルは第三者の配布物を初回に自動ダウンロードして利用します。配布元の都合により 将来利用できなくなる可能性があります。 - デジタル商品の性質上、**購入後の返金は原則お受けできません**。動作環境を必ずご確認の上 お求めください。 - 詳細は同梱の利用規約(EULA.txt)をご確認ください。 ### クレジット 本アプリは以下のオープンソースソフトウェア・モデルを利用しています。 Ultimate Vocal Remover (UVR)とその開発者の皆さま / python-audio-separator / Mel-Band RoFormer Vocals by becruily / UVR-DeEcho-DeReverb, UVR-DeNoise by FoxJoy / Silero VAD / SpeechBrain / CustomTkinter / PyTorch ### 更新履歴 - v1.0.0 (2026-07-18) 初回リリース


