Deepgramで日本語を文字起こし|AIエージェントを使うなら、SaaSより直接APIが速い
目次
AIエージェントを普段使っているなら、録音の文字起こしはSaaSを契約するより、APIを直に叩くほうが速い。
Deepgramは、音声を入れると議事録まで完成するサービスではありません。文字起こしだけを引き受けて、結果をデータで返すAPIです。
そのデータを受け取ったあと、要約するのも、体裁を整えるのも、保存先を決めるのも自分。ここを面倒と見るか、自由と見るかで評価が割れます。
Claude CodeやChatGPTに普段から作業を頼んでいるなら、後者です。
私は1分14秒の日本語音声を、Nova-3で2回処理しました。プログラムは書かず、コマンド1回だけ。
実際に消費したのはUS$0.0125=日本円で約2円でした。
書いた人 サトシ 文字起こしサービスとAIレコーダーをたくさん検証している人
会議と記録に追われている非エンジニアです。音声入力や文字起こしAI、そして文字起こしを要約してくれるAIを使い倒したら、日々の業務がめっちゃ楽になりました。 その手応えから、文字起こしサービスもAIレコーダーも自腹で契約・購入し、同じ音源を入れて結果を見比べています。 音声入力は Aqua Voice を日常的に愛用し、議事録要約の NotebookLM は仕事でもプライベートでも1年以上活用中。 個人情報を扱う仕事柄、セキュリティや運営元の素性は人一倍シビアにチェックします。 このサイトは、その実測ログの置き場です。
先に、この記事の答えを4つ。
- Deepgramは文字起こしだけを返すAPI。続きは自分のAIエージェントに任せる(→SaaSとの違い)
- 登録から実行まで、エージェントに投げる文はこれだけ(→投げるプロンプト)
- 1分14秒×2回で$0.0125=約2円。1時間の会議なら約42円(→料金の実額)
- 一般的な日本語は読めるが、自社固有の語は事前準備が要る(→日本語の精度)
この記事で使うものは次の4つ。
- Deepgramの無料アカウント(クレジットカード不要)
- Claude CodeやChatGPTなどのAIエージェント
- 個人情報を含まないテスト音源
- MacまたはWindowsのターミナル
順に、投げるプロンプト → SaaSとの違い → 動かし方 → 料金 → 日本語の精度、で見ていきます。
最初にやること:この1つをエージェントに投げる
登録から最初の1回まで、自分で調べる必要はありません。次の文をそのまま渡します。
Deepgramで日本語の音声ファイルを文字起こししたいです。
アカウント登録とAPIキーの発行から、コマンドを1回動かすところまで進めたい。
私がブラウザでやる操作は、その都度指示してください。
コマンドは私の環境に合わせて書いてもらえると助かります。
音声は sample.m4a、モデルは nova-3、言語は日本語でお願いします。
返ってくるのは、次の4つです。
- 公式サイトのどこで登録し、どの画面でキーを発行するかの案内
- 自分の環境で動く形に整えたコマンド
- 実行して詰まったときの、原因の切り分け
- 返ってきたデータから、読める文章を取り出す方法
私自身、管理画面のどこに課金の内訳があるかを探す場面は、エージェントに任せました。
Billing → Spend という階層は、公式ドキュメントを探すより聞いたほうが早い。分からない場所を探させるのは、エージェントがいちばん得意な仕事です。
ここから先は、そのエージェントが何をやっているのかを、自分でも把握しておくための説明です。
丸投げでも動きます。ただし返ってきた結果が正しいか判断できるのは、仕組みを知っている人だけです。
1. 違うのは、あとの工程を誰が決めるか
Deepgramの主役は、録音・編集・要約・共有まで揃った画面ではありません。APIへ音声を送り、結果をデータで受け取るサービスです。
「録音を入れたら、どこに議事録が保存されるの?」——保存先は、自分で決めます。
違いは精度でも料金でもなく、文字起こしのあとを誰が決めるかです。
| SaaS(Notta・PLAUDなど) | Deepgram | |
|---|---|---|
| 録音の取り込み | 画面から操作 | APIへ送信 |
| 日本語文字起こし | できる | できる |
| 要約・議事録 | サービスが決めた形 | 自分のAIエージェントに任せる |
| スマホでの手軽さ | 高い | 低い |
| 結果の持ち出し | 書き出し機能の範囲 | JSONをそのまま渡せる |
| 料金 | 月額・年額が中心 | 使った分だけ |
返ってくるJSONは、人が読むには不便な形です。ただし相手がAIなら話は別。
そのまま渡せば、要約も、担当と期限の抽出も、社内フォーマットへの流し込みも続けて頼めます。人間向けの整形を挟まずに済むぶん、むしろ都合がいい。
この流れ自体は、別のサービスで実測済みです。
PLAUDの録音を取り出し、APIで文字起こしし直した記録がPLAUDの録音は自分で文字起こしし直せる。
Whisperの導入をエージェントに任せた記録がWhisper×AIエージェントにあります。
Deepgramは、その並びに置ける選択肢のひとつです。
ただし録音を1本ずつ手軽に処理したいだけなら、SaaSのほうが近道。
迷うなら文字起こしツールの比較で足りるかを先に確かめてください。
2. 登録からコマンド1回まで。書かせる相手はエージェントでもいい
最初の1回だけなら、プログラムを作らなくても試せます。公式ドキュメントも、録音済み音声の手順にcURLを用意しています。
流れは5ステップ。
- Deepgram公式サイトで無料アカウントを作成
- 管理画面でAPIキーを発行
- テスト用音声を
sample.m4aという名前で用意 - Macの「ターミナル」、またはWindowsのターミナルを開く
- 次のコマンドで、キーとファイル名を自分のものに置き換えて実行
curl \
--request POST \
--header "Authorization: Token YOUR_DEEPGRAM_API_KEY" \
--header "Content-Type: audio/mp4" \
--data-binary @sample.m4a \
--url "https://api.deepgram.com/v1/listen?model=nova-3&language=ja&smart_format=true&mip_opt_out=true"
指定しているのは4つ。
model=nova-3: 使うモデルlanguage=ja: 日本語を明示。指定なしの既定値は英語smart_format=true: 句読点や数字の整形mip_opt_out=true: このリクエストをモデル改善プログラムから除外
返ってくるのは、文字起こしの文章そのものではなくJSONという形のデータです。本文は results → channels → alternatives → transcript の中にあります。
つまずいたのは、精度ではなく実行環境
私が最初に試したのはPythonの公式SDKでした。ところがPython 3.13の環境でSSL証明書のエラーが出て、接続できません。
証明書の設定を追いかける前に、cURLへ切り替えて解決しています。
最初の1回は、SDKよりcURLのほうが確実。動くことを確かめてから、必要ならSDKへ移ればいい。
APIキーはパスワードと同じ扱いです。スクリーンショット、ブログ、GitHubへ載せないでください。誤って公開したら、そのキーを削除して作り直します。
コマンドを書くのは、自分でなくてもいい
私はこのコマンドを手で実行しました。ただ、普段からClaude CodeやChatGPTに作業を頼んでいるなら、この1行もエージェントに書かせて構いません。
Whisperの導入も、PLAUDからの音声の取り出しも、手順ごとエージェントに任せた記録があります(Whisper×AIエージェント/PLAUDの録音を文字起こしし直す)。
大事なのは、最初の1回を自分の目で通しておくこと。動く形を知らないまま任せると、返ってきた結果が正しいのか判断できません。
ここまでで、Deepgramが自分に扱えるかは判断できます。まずは10秒ほどの架空音声で1回だけ実行してみてください。
3. 料金は1分14秒×2回で$0.0125=約2円。うち13%は追加機能だった
私が同一音源を2回処理したときの消費額は、US$0.01250。日本円にすると約2円です。管理画面の請求内訳で確認した実績値です(2026年8月22日)。
この記事の円換算は、すべて1ドル160円で計算しています(2026年9月2日時点のレート)。
内訳まで見ると、単価表だけではわからないことが出てきます。
| 項目 | 割合 | 金額 | 日本円 |
|---|---|---|---|
| Nova-3(録音済みの文字起こし) | 87% | 約$0.0109 | 約1.7円 |
| Keyterm Prompting(専門語の登録) | 13% | 約$0.0016 | 約0.3円 |
文字起こし本体とは別に、使った機能のぶんが加算される。keytermを使わなければ$0.0109、使えば$0.0125。1本あたりの差は小さくても、本数が増えれば効いてきます。
Deepgramの公表単価は、2026年9月2日時点で次のとおり。録音済みとリアルタイムで単価が違います。
| 処理 | Nova-3 単一言語 | 日本円 | Nova-3 多言語 | 日本円 |
|---|---|---|---|---|
| 録音済みファイル | $0.0043/分 | 約0.7円/分 | $0.0052/分 | 約0.8円/分 |
| リアルタイム | $0.0048/分 | 約0.8円/分 | $0.0058/分 | 約0.9円/分 |
1時間の会議を録音済みで処理するなら、$0.0043×60分=約$0.26。日本円で約42円です。
同じ会議を週2本、1年続けても$27前後=約4,300円にしかなりません。
新規アカウントにはUS$200、日本円で約32,000円ぶんの無料クレジットが付きます。公式料金ページの条件は3点。
- クレジットカード不要
- 最低利用額なし
- 期限なし
個人のテストで200ドルを使い切るのは、まず起こりません。ただし、無料であることと上限管理が不要であることは別。
上の内訳のように機能ぶんが積み上がります。本格運用に移す前に、管理画面の消費量を月1回は確認してください。
料金は改定されます。使う前にDeepgramの公式料金ページで現行単価を確認するのが確実です。
4. 日本語の業務語は、事前準備なしでは任せにくい
精度も測りました。使ったのは、業務で間違えやすい21語をわざと入れた1分14秒の読み上げ音源です。稟議、決裁、按分、カスサク、石動という難読姓、雛形など。
結果は次のとおり。
| 条件 | 正解した語 | 正答率 |
|---|---|---|
| 用語を渡さない | 10/21 | 48% |
| keytermで21語を渡す | 14/21 | 67% |
この48%は、日本語全体の正答率ではありません。間違えやすい語だけを21個選んだ意地悪なテストです。
日常語はおおむね読めていました。崩れたのは難読姓・社内略語・同音異義語に集中しています。
言えるのは、一般的な日本語は文になるが、自社固有の語は事前準備なしで任せにくいということ。
Nova-3には keyterm という機能があり、認識してほしい語を先に渡せます。コマンドではURLの末尾へ語数ぶん追加するだけ。
&keyterm=按分&keyterm=カスサク&keyterm=石動&keyterm=雛形
上限は1リクエストあたり500トークン。渡しすぎるより、実際に間違えた20語から始めるほうが現実的です。
効果と副作用(「笠原」が「笠原所」になるなど)や、PLAUD・OpenAIとの効き方の違いは別記事に。
文字起こしの辞書機能を3つのサービスで比べたに、21語すべての結果があります。
自分の用途で判断するなら、会社名・商品名・部署名・人名を入れた30秒の台本を作って測るのが最短です。
5. 録音済みはNova-3、音声エージェントはFlux
用途で分けるとシンプルです。
| やりたいこと | 候補 |
|---|---|
| 録音済みの会議・インタビューを文字起こし | Nova-3 |
| 会議字幕をリアルタイム表示 | Nova-3 |
| 電話AIが人の発話終了を判断 | Flux |
| 会話の割り込みを扱う音声エージェント | Flux |
Nova-3は汎用の音声認識モデルで、録音済みとリアルタイムの両方に対応。日本語は多言語対応に含まれ、language=ja で指定します。
Fluxは音声エージェント向けのリアルタイムモデルです。話し終わったか、割り込んだかという会話のターンを扱う設計。日本語は flux-general-multi で対応しています。
なお、医療特化の nova-3-medical は英語のみ。日本語の医療音声に特化したモデルではありません。
この記事で実測したのはNova-3の録音済み処理だけです。Fluxの日本語応答速度は、この結果からは判定できません。保存済みの音声から始めるならNova-3を選んでください。
6. 音声データを送る前に確認する3点
無料で動いたからといって、すぐ実データに切り替えないでください。確認するのは最低3点です。
mip_opt_out=true を意図して選ぶ
各リクエストに mip_opt_out=true を付けると、そのデータをModel Improvement Programから除外できます。
除外したリクエストのデータは、処理に必要な期間のみ保持されるという公式説明です。
2026年3月5日以降、Pay As You GoとGrowthはプログラムへの参加有無で公開料金が変わりません。曖昧にせず、リクエストで明示してください。
日本語の個人情報は自動の赤塗りに任せない
DeepgramにはRedaction(赤塗り)機能があります。ただし氏名・住所・病名などを認識するエンティティ赤塗りは、公式ドキュメント上で英語のみ。
数字の赤塗りは録音済みなら全対応言語で使えます。それでも、日本語の氏名や病名が自動で消えるとは考えないでください。
医療・人事・顧客対応の音声は、実データを入れる前に組織の規程と契約を確認。公開できる架空音声で試すのが先です。
APIキーと課金を管理する
キーが漏れると、別の人がそのキーで利用できます。コマンド履歴・共有フォルダ・画面キャプチャに残さない運用が必要です。
本格運用では、権限を絞ったキーを使い、不要になったキーは失効させます。テスト用と本番用のプロジェクトを分けると管理しやすくなります。
最初のテストは、個人情報のない10秒音声で。これなら精度・操作・課金の3つを小さく確かめられます。
7. Deepgramが向く人、向かない人
判断基準は、精度より先に「完成した画面が欲しいか、続きを自分で決めたいか」の一点です。
向く人
- Claude CodeやChatGPTに、普段から作業を頼んでいる人
- 文字起こしのあとの要約・整形を、自分の形に決めたい人
- 毎日、同じ手順で複数の音声を処理する人
- 月額プランより、処理した時間に応じて払いたい人
- 社内のフォルダや顧客管理ツールへ、そのまま流したい人
向かない人
- スマホで録音し、ボタン1つで文字起こししたい人
- 要約・議事録・共有ページを、契約したその日から使いたい人
- コマンドを1度も実行したくない人
- データ保存・学習利用・アクセス権限の設計を自分たちで行えない組織
- 日本語音声の氏名や病名が自動で完全に消えることを前提にしたい人
会社として完成SaaSを選ぶなら、法人向けAI議事録サービス8選のように、会議基盤・管理機能・保存・料金を含めて比べる必要があります。
すでにAIエージェントへ日常的に仕事を頼んでいて、録音だけ別のサービスに預けているなら、試す価値があります。10秒の架空音声とコマンド1回で、相性は判断できます。
まとめ:続きを預けるか、自分で決めるか
- Deepgramは完成SaaSではなく、文字起こしだけを返すAPI。続きは自分のAIエージェントに任せる
- 日本語のNova-3は、プログラムを書かずコマンド1回で動いた
- 1分14秒×2回の実測で$0.0125=約2円。1時間の会議なら約42円。うち13%はkeytermの追加ぶん
- 難語21語の正答は10語、keytermを渡して14語。自社固有の語は事前準備が要る
- 個人情報を含む日本語音声は、
mip_opt_out=trueと契約条件を確認し、自動の赤塗りだけに任せない
録音を1本ずつ手で処理するなら、SaaSのほうが簡単です。同じ処理を繰り返し、そのままAIへ続きを頼みたいならDeepgramの出番。
すでにAIエージェントに仕事を任せているなら、文字起こしだけを別のサービスに預ける理由は、あまり残りません。
よくある質問
プログラミングができなくても使えますか?
最初の1回はコマンドを1行実行するだけです。公式ドキュメントが録音済み音声の手順にcURLを用意しています。普段Claude CodeやChatGPTに作業を頼んでいるなら、そのコマンド自体をエージェントに書かせても構いません。返ってくるのはJSONというデータの形なので、読みやすい議事録に整える工程は、そのままエージェントに続けて頼めます。
日本語に対応していますか?
対応しています。Nova-3の多言語対応に日本語が含まれていて、リクエストに language=ja と指定します。指定しない場合の既定値は英語なので、日本語音声を送るときは必ず付けてください。音声エージェント向けのFluxも flux-general-multi で日本語に対応しています。
無料でどこまで使えますか?
新規アカウントに200ドル、1ドル160円の換算で約32,000円ぶんの無料クレジットが付きます。クレジットカードの登録は不要、最低利用額なし、期限なしという条件です。1分14秒の音声を2回処理した私の実測では0.0125ドル、日本円で約2円しか減らなかったので、個人のテストで使い切ることはまず起こりません。
1時間の会議を文字起こしすると、いくらかかりますか?
録音済みファイルをNova-3の単一言語で処理する場合、2026年9月2日時点の公表単価は1分あたり0.0043ドルです。1時間なら約0.26ドル、1ドル160円の換算で約42円。同じ会議を週2本、1年続けても27ドル前後、日本円で約4,300円の計算になります。ただし専門用語を登録するkeytermなどの機能を使うと、その分が別に加算されます。
社内の会議音声をそのまま送っても大丈夫ですか?
先に確認することがあります。各リクエストに mip_opt_out=true を付ければモデル改善プログラムからデータを除外できますが、氏名や病名を自動で伏せるエンティティ赤塗り機能は公式ドキュメント上で英語のみの対応です。日本語の個人情報が自動で消えるとは考えず、まず個人情報を含まない架空音声で試してください。