数秒の音声サンプルからその人の声の特徴を取り出し、その声で任意の文章を読み上げさせる仕組みです。もとは修士論文として書かれた研究用の実装で、論文の手法をそのまま形にしたものです。
#音声合成#声クローン
ミロンドが自分で確かめたこと
- 2026年8月23日「配布元を見る」の行き先が、今も開けることを確認しました。
- 2026年8月14日利用ルールの原文(LICENSE)を読みました。特別な条件は書かれていませんでした。
- 2026年7月31日公式の説明を読んで、開発が止まったというサインが無いことを確認しました。
- 2026年8月25日ミロンドが毎日数えている記録では、この17日間で お気に入りが16件増えました(今も使われ続けています)。
ミロンドは掲載しているすべての行き先を定期的に開いて、今も使えるかを確かめています。 利用ルールは名前だけで判断せず、原文を読んで確認しています。
「音声生成」119本の中での位置
- APIキーの用意がいらないこの分野で114本
- 黒い画面(ターミナル)の操作が要りますそうでないものが93本 →
- 入れた内容は公開元に送られますそうでないものが30本 →
この数字は、ミロンドが掲載している道具を1本ずつ同じ基準で調べた結果から数えています。
これは何?黒い画面(ターミナル)で動かすツール
できること
短い音声からの声の特徴抽出/その声での文章の読み上げ
誰に効く?
声を写し取る技術の仕組みを学びたい人
用意するもの
コマンド入力との環境が必要です。研究用の実装なので、導入はすぐ使えるアプリに比べて手間がかかります。
時間のめやす
15〜30分(AIに聞きながらコピペ)
使うとこうなる
- 1ffmpegを入れる→音声ファイルを読める
- 2uvでdemo_toolboxを実行→画面付きで試せる
- 3音声と文章を入れる→合成音声が生成される
作れるもの・できることの例
声質サンプル実験、読み上げ音声、音声合成デモ
使えるようになるまでの手順をひらく
- 「」という文字だけの画面を使います(Windowsなら PowerShell)
- GitHubページの「Installation」に書かれたコマンドを順番に実行
- つまずいたら、いつも使っているAIチャットに「(ツール名)のインストールを手伝って」と聞くのがおすすめ
こんな人には向かないかも
- 黒い画面(ターミナル)にまだ抵抗がある人
迷ったらこれ:いつも使っているAIチャット(ChatGPT・Claude・Geminiなど)にこのツールのGitHubリンクを貼って 「これを使いたい。私のPCでの始め方を一歩ずつ教えて」と頼むのが一番の近道です。
他人の顔や声を扱う前に
本人の許可なく顔や声を使い、その人が言っていない・していないことをしているように 見せる映像や音声を作って公開すると、名誉毀損や肖像権・パブリシティ権の侵害として 損害賠償や刑事責任を問われることがあります。性的な内容にした場合や、 実在の人物になりすまして金銭をだまし取る目的で使った場合は、さらに重い責任を問われます。 使ってよいのは、自分自身の素材か、内容と公開範囲まで説明したうえで許可を得た相手の素材だけだと 考えてください。手元のパソコンだけで処理できることと、作ったものを公開してよいことは別の問題です。
注意点
他人の顔や声を無断で使い、本人が言っていない・していないことをしているように見せる映像や音声を作って公開すると、名誉毀損や肖像権・パブリシティ権の侵害として、損害賠償や刑事責任を問われることがあります。性的な内容にした場合や、実在の人物になりすまして金銭をだまし取る目的で使った場合は、さらに重い責任を問われます。使ってよいのは、自分自身か、内容と公開範囲まで説明したうえで許可を得た相手の素材だけだと考えてください。 技術面では、これは2019年の修士論文にもとづく研究用の実装です。声を写し取る技術はその後大きく進歩しているので、実用の品質を求めるなら、より新しいツールを検討してください。仕組みを学ぶ目的には向いています。
ひとことメモ
として公開されています。内容は公式ページでもご確認ください。
Real-Time-Voice-Cloningについてよくある質問
- Real-Time-Voice-Cloningは無料で使えますか?
- 無料で使えます。自分のパソコンの中で動くタイプなので、使った量に応じた料金もかかりません。
- Real-Time-Voice-Cloningを使うのに、インストールや専門知識は必要ですか?
- コマンド入力(黒い画面)での操作が必要です。手順どおりに文字を打ち込む作業に慣れていないと、導入でつまずきやすいツールです。
- Real-Time-Voice-Cloningはスマホでも使えますか?
- スマホには対応していません。パソコンが必要です。
- Real-Time-Voice-Cloningは仕事(商用)で使えますか?
- 公開元がライセンスをはっきり書いていないため、商用で使ってよいかは判断できません。仕事で使う場合は、公式ページで確認するか、作者に問い合わせてください。
似ている道具との違い
同じ用途の道具と、使う前に効いてくる条件を並べました。
| 道具 | 黒い画面 | APIキー | 外部送信 | スマホ | 仕事に使える | 最終更新 |
|---|---|---|---|---|---|---|
| Real-Time-Voice-Cloning(このページ) | 要る | いらない | あり | むずかしい | 未確認 | 2026年3月 |
| fish-s2-pro-zero | いらない | いらない | あり | 使える | 未確認 | 2026年3月 |
| Coqui TTS | 要る | いらない | なし | むずかしい | 可 | 2024年8月 |
| Bark | 要る | いらない | なし | むずかしい | 可 | 2024年8月 |
「外部送信あり」は、入力した内容がどこかのサーバーに送られることを指します。 社外に出せない資料を扱うときは「なし」を選んでください。
音声生成のほかのツール
Real-Time-Voice-Cloningが合わなかったときの、同じ用途の候補です。
fish-s2-pro-zero
声をまねて読み上げ
準備がいる・黒い画面(ターミナル)いらない
Coqui TTS
声を再現できる音声合成ライブラリ
準備がいる・黒い画面(ターミナル)が要る
Bark
テキストから自然な音声を作る
準備がいる・黒い画面(ターミナル)が要る
Chatterbox-TTS-Server
自分のパソコンで動かす、読み上げ音声の作成環境
準備がいる・黒い画面(ターミナル)が要る
ComfyUI-OmniVoice-TTS
600以上の言語に対応した読み上げを ComfyUI で使う
準備がいる・黒い画面(ターミナル)が要る
E2-F5-TTS
数秒の音声から声を写し取って読み上げさせるページ(商用可)
準備がいる・黒い画面(ターミナル)いらない
