会話の台本を渡すと、二人分の掛け合いをまとめて音声にするAIです。一人ずつ作って後でつなぐのではなく、会話全体を一度に生成するので、間の取り方や感情の流れが自然になります。笑い声、咳払い、息継ぎといった言葉以外の音も出せます。今のところ英語のみの対応です。
#対話音声#TTS
ミロンドが自分で確かめたこと
- 2026年8月23日「配布元を見る」の行き先が、今も開けることを確認しました。
- 2026年8月14日利用ルールの原文(LICENSE)を読みました。特別な条件は書かれていませんでした。
- 2026年7月30日公式の説明を読んで、開発が止まったというサインが無いことを確認しました。
- 2026年8月25日ミロンドが毎日数えている記録では、この17日間で お気に入りが15件増えました(今も使われ続けています)。
ミロンドは掲載しているすべての行き先を定期的に開いて、今も使えるかを確かめています。 利用ルールは名前だけで判断せず、原文を読んで確認しています。
「音声生成」119本の中での位置
- APIキーの用意がいらないこの分野で114本
- 入れた内容を外部に送らないこの分野で30本
- 作ったものを仕事に使ってよいと確認できているこの分野で56本
- 黒い画面(ターミナル)の操作が要りますそうでないものが93本 →
上の条件をすべて満たすものは、119本中24本です。
この数字は、ミロンドが掲載している道具を1本ずつ同じ基準で調べた結果から数えています。
これは何?黒い画面(ターミナル)で動かすツール
できること
台本からの会話音声の生成/二人分の掛け合いを一度に生成/笑い・咳払いなど言葉以外の音/参考音声を渡しての声や感情の指定/HuggingFaceの標準的な仕組みからも利用可
誰に効く?
英語の会話音声を作りたい人。ラジオ風の音声や試作を作りたい人
用意するもの
コマンド入力との環境が必要です。実用的な速さを出すにはグラフィックボードが要ります。英語のみ対応です。
時間のめやす
15〜30分(AIに聞きながらコピペ)
使うとこうなる
- 1台本を用意すると→話者つき音声の入力になる
- 2モデルに渡すと→対話音声が生成される
- 3参考音声を使うと→感情や声の条件付けができる
作れるもの・できることの例
会話デモ音声、ドラマ風の試作音声、音声UIのサンプル
使えるようになるまでの手順をひらく
- 「」という文字だけの画面を使います(Windowsなら PowerShell)
- GitHubページの「Installation」に書かれたコマンドを順番に実行
- つまずいたら、いつも使っているAIチャットに「(ツール名)のインストールを手伝って」と聞くのがおすすめ
こんな人には向かないかも
- 黒い画面(ターミナル)にまだ抵抗がある人
迷ったらこれ:いつも使っているAIチャット(ChatGPT・Claude・Geminiなど)にこのツールのGitHubリンクを貼って 「これを使いたい。私のPCでの始め方を一歩ずつ教えて」と頼むのが一番の近道です。
注意点
日本語には対応していません(2026-08-15時点の公式説明)。参考音声を渡して声を似せられるため、他人の声を無断で使わないでください。後継版(Dia2)が公開されているので、新しく始めるならそちらも確認することをおすすめします。はApache-2.0ですが、モデルの重みデータには別の条件が付く場合があるので、配布元の記載をご確認ください。
ひとことメモ
として公開されています。内容は公式ページでもご確認ください。
diaについてよくある質問
- diaは無料で使えますか?
- 無料で使えます。自分のパソコンの中で動くタイプなので、使った量に応じた料金もかかりません。
- diaを使うのに、インストールや専門知識は必要ですか?
- コマンド入力(黒い画面)での操作が必要です。手順どおりに文字を打ち込む作業に慣れていないと、導入でつまずきやすいツールです。
- diaはスマホでも使えますか?
- スマホには対応していません。パソコンが必要です。
- diaは仕事(商用)で使えますか?
- ライセンスは Apache-2.0 で、商用利用も認められています。ただし著作権表示を残すなどの条件が付くので、配布物に含める場合はライセンス本文を確認してください。
似ている道具との違い
同じ用途の道具と、使う前に効いてくる条件を並べました。
| 道具 | 黒い画面 | APIキー | 外部送信 | スマホ | 仕事に使える | 最終更新 |
|---|---|---|---|---|---|---|
| dia(このページ) | 要る | いらない | なし | むずかしい | 可 | 2025年11月 |
| VibeVoice-ComfyUI | 要る | いらない | なし | むずかしい | 可 | 2026年2月 |
| Irodori-TTS | 要る | いらない | あり | むずかしい | 可 | 2026年8月 |
| Chatterbox-TTS-Extended | 要る | いらない | あり | むずかしい | 可 | 2025年8月 |
「外部送信あり」は、入力した内容がどこかのサーバーに送られることを指します。 社外に出せない資料を扱うときは「なし」を選んでください。
音声生成のほかのツール
diaが合わなかったときの、同じ用途の候補です。
VibeVoice-ComfyUI
ComfyUIの中で、複数人の会話音声を作る
準備がいる・黒い画面(ターミナル)が要る
Irodori-TTS
日本語の読み上げ音声を、絵文字で表情づけする
準備がいる・黒い画面(ターミナル)が要る
Chatterbox-TTS-Extended
読み上げ音声を、大量に・粗を減らして作り込む
上級者向け・黒い画面(ターミナル)が要る
ComfyUI-OmniVoice-TTS
600以上の言語に対応した読み上げを ComfyUI で使う
準備がいる・黒い画面(ターミナル)が要る
personalized-podcast
記事や資料を、二人が語る音声番組に変える
準備がいる・黒い画面(ターミナル)が要る
Kokoro-TTS
自然な読み上げ音声を作れるページ(商用利用も可)
上級者向け・黒い画面(ターミナル)いらない
