9/10まで PLAUD全4機種が20%オフ|1000店舗達成記念セール
音声の波が teal 色のアーチをくぐり、整然と積まれた四角いブロックの列に変わるイラスト。その先には点線で描かれた空の枠が浮かんでいる。文字は入れず、音声がAPIを通ってデータになり、その先の組み立ては自分に委ねられることを表す

Deepgramで日本語を文字起こし|AIエージェントを使うなら、SaaSより直接APIが速い

公開: 2026年9月2日

目次
  1. 最初にやること:この1つをエージェントに投げる
  2. 1. 違うのは、あとの工程を誰が決めるか
  3. 2. 登録からコマンド1回まで。書かせる相手はエージェントでもいい
    1. つまずいたのは、精度ではなく実行環境
    2. コマンドを書くのは、自分でなくてもいい
  4. 3. 料金は1分14秒×2回で$0.0125=約2円。うち13%は追加機能だった
  5. 4. 日本語の業務語は、事前準備なしでは任せにくい
  6. 5. 録音済みはNova-3、音声エージェントはFlux
  7. 6. 音声データを送る前に確認する3点
    1. mip_opt_out=true を意図して選ぶ
    2. 日本語の個人情報は自動の赤塗りに任せない
    3. APIキーと課金を管理する
  8. 7. Deepgramが向く人、向かない人
    1. 向く人
    2. 向かない人
  9. まとめ:続きを預けるか、自分で決めるか

AIエージェントを普段使っているなら、録音の文字起こしはSaaSを契約するより、APIを直に叩くほうが速い。

Deepgramは、音声を入れると議事録まで完成するサービスではありません。文字起こしだけを引き受けて、結果をデータで返すAPIです。

そのデータを受け取ったあと、要約するのも、体裁を整えるのも、保存先を決めるのも自分。ここを面倒と見るか、自由と見るかで評価が割れます。

Claude CodeやChatGPTに普段から作業を頼んでいるなら、後者です。

私は1分14秒の日本語音声を、Nova-3で2回処理しました。プログラムは書かず、コマンド1回だけ。

実際に消費したのはUS$0.0125=日本円で約2円でした。

運営者satoshiのアイコン 書いた人 サトシ 文字起こしサービスとAIレコーダーをたくさん検証している人

会議と記録に追われている非エンジニアです。音声入力や文字起こしAI、そして文字起こしを要約してくれるAIを使い倒したら、日々の業務がめっちゃ楽になりました。 その手応えから、文字起こしサービスもAIレコーダーも自腹で契約・購入し、同じ音源を入れて結果を見比べています。 音声入力は Aqua Voice を日常的に愛用し、議事録要約の NotebookLM は仕事でもプライベートでも1年以上活用中。 個人情報を扱う仕事柄、セキュリティや運営元の素性は人一倍シビアにチェックします。 このサイトは、その実測ログの置き場です。

先に、この記事の答えを4つ。

  1. Deepgramは文字起こしだけを返すAPI。続きは自分のAIエージェントに任せる(→SaaSとの違い
  2. 登録から実行まで、エージェントに投げる文はこれだけ(→投げるプロンプト
  3. 1分14秒×2回で$0.0125=約2円。1時間の会議なら約42円(→料金の実額
  4. 一般的な日本語は読めるが、自社固有の語は事前準備が要る(→日本語の精度

この記事で使うものは次の4つ。

  1. Deepgramの無料アカウント(クレジットカード不要)
  2. Claude CodeやChatGPTなどのAIエージェント
  3. 個人情報を含まないテスト音源
  4. MacまたはWindowsのターミナル

順に、投げるプロンプト → SaaSとの違い → 動かし方 → 料金 → 日本語の精度、で見ていきます。

最初にやること:この1つをエージェントに投げる

登録から最初の1回まで、自分で調べる必要はありません。次の文をそのまま渡します。

Deepgramで日本語の音声ファイルを文字起こししたいです。
アカウント登録とAPIキーの発行から、コマンドを1回動かすところまで進めたい。

私がブラウザでやる操作は、その都度指示してください。
コマンドは私の環境に合わせて書いてもらえると助かります。

音声は sample.m4a、モデルは nova-3、言語は日本語でお願いします。

返ってくるのは、次の4つです。

  1. 公式サイトのどこで登録し、どの画面でキーを発行するかの案内
  2. 自分の環境で動く形に整えたコマンド
  3. 実行して詰まったときの、原因の切り分け
  4. 返ってきたデータから、読める文章を取り出す方法

私自身、管理画面のどこに課金の内訳があるかを探す場面は、エージェントに任せました。

Billing → Spend という階層は、公式ドキュメントを探すより聞いたほうが早い。分からない場所を探させるのは、エージェントがいちばん得意な仕事です。

ここから先は、そのエージェントが何をやっているのかを、自分でも把握しておくための説明です。

丸投げでも動きます。ただし返ってきた結果が正しいか判断できるのは、仕組みを知っている人だけです。

1. 違うのは、あとの工程を誰が決めるか

Deepgramの主役は、録音・編集・要約・共有まで揃った画面ではありません。APIへ音声を送り、結果をデータで受け取るサービスです。

「録音を入れたら、どこに議事録が保存されるの?」——保存先は、自分で決めます。

文字起こしのあとの工程を誰が決めるかを比べた図。SaaSに任せる場合は、画面から取り込むとサービスが決めた形で要約され、決まった画面に議事録が出る。APIを直に使う場合は、コマンド1回でJSONが返り、そのあとの要約と保存は自分のAIエージェントが担当するため、自分の形に合わせられる
分かれるのは、続きを預けるか自分で決めるか

違いは精度でも料金でもなく、文字起こしのあとを誰が決めるかです。

SaaS(Notta・PLAUDなど)Deepgram
録音の取り込み画面から操作APIへ送信
日本語文字起こしできるできる
要約・議事録サービスが決めた形自分のAIエージェントに任せる
スマホでの手軽さ高い低い
結果の持ち出し書き出し機能の範囲JSONをそのまま渡せる
料金月額・年額が中心使った分だけ

返ってくるJSONは、人が読むには不便な形です。ただし相手がAIなら話は別。

そのまま渡せば、要約も、担当と期限の抽出も、社内フォーマットへの流し込みも続けて頼めます。人間向けの整形を挟まずに済むぶん、むしろ都合がいい。

この流れ自体は、別のサービスで実測済みです。

PLAUDの録音を取り出し、APIで文字起こしし直した記録がPLAUDの録音は自分で文字起こしし直せる

Whisperの導入をエージェントに任せた記録がWhisper×AIエージェントにあります。

Deepgramは、その並びに置ける選択肢のひとつです。

ただし録音を1本ずつ手軽に処理したいだけなら、SaaSのほうが近道

迷うなら文字起こしツールの比較で足りるかを先に確かめてください。

2. 登録からコマンド1回まで。書かせる相手はエージェントでもいい

最初の1回だけなら、プログラムを作らなくても試せます。公式ドキュメントも、録音済み音声の手順にcURLを用意しています。

流れは5ステップ。

  1. Deepgram公式サイトで無料アカウントを作成
  2. 管理画面でAPIキーを発行
  3. テスト用音声を sample.m4a という名前で用意
  4. Macの「ターミナル」、またはWindowsのターミナルを開く
  5. 次のコマンドで、キーとファイル名を自分のものに置き換えて実行
DeepgramのAPIキー管理画面。mojioko-benchmarkという名前のキーが1つあり、Secretの列はアスタリスクで伏せられている。作成日は2026年8月23日、有効期限の列はハイフンで無期限を示している
発行済みのキー。作成後、鍵そのものは二度と表示されない
curl \
  --request POST \
  --header "Authorization: Token YOUR_DEEPGRAM_API_KEY" \
  --header "Content-Type: audio/mp4" \
  --data-binary @sample.m4a \
  --url "https://api.deepgram.com/v1/listen?model=nova-3&language=ja&smart_format=true&mip_opt_out=true"

指定しているのは4つ。

  • model=nova-3: 使うモデル
  • language=ja: 日本語を明示。指定なしの既定値は英語
  • smart_format=true: 句読点や数字の整形
  • mip_opt_out=true: このリクエストをモデル改善プログラムから除外

返ってくるのは、文字起こしの文章そのものではなくJSONという形のデータです。本文は resultschannelsalternativestranscript の中にあります。

つまずいたのは、精度ではなく実行環境

私が最初に試したのはPythonの公式SDKでした。ところがPython 3.13の環境でSSL証明書のエラーが出て、接続できません。

証明書の設定を追いかける前に、cURLへ切り替えて解決しています。

最初の1回は、SDKよりcURLのほうが確実。動くことを確かめてから、必要ならSDKへ移ればいい。

APIキーはパスワードと同じ扱いです。スクリーンショット、ブログ、GitHubへ載せないでください。誤って公開したら、そのキーを削除して作り直します。

コマンドを書くのは、自分でなくてもいい

私はこのコマンドを手で実行しました。ただ、普段からClaude CodeやChatGPTに作業を頼んでいるなら、この1行もエージェントに書かせて構いません。

Whisperの導入も、PLAUDからの音声の取り出しも、手順ごとエージェントに任せた記録があります(Whisper×AIエージェントPLAUDの録音を文字起こしし直す)。

大事なのは、最初の1回を自分の目で通しておくこと。動く形を知らないまま任せると、返ってきた結果が正しいのか判断できません。

ここまでで、Deepgramが自分に扱えるかは判断できます。まずは10秒ほどの架空音声で1回だけ実行してみてください。

3. 料金は1分14秒×2回で$0.0125=約2円。うち13%は追加機能だった

私が同一音源を2回処理したときの消費額は、US$0.01250。日本円にすると約2円です。管理画面の請求内訳で確認した実績値です(2026年8月22日)。

この記事の円換算は、すべて1ドル160円で計算しています(2026年9月2日時点のレート)。

内訳まで見ると、単価表だけではわからないことが出てきます。

1分14秒の音声を2回処理したときの課金額0.0125ドルの内訳を示した図。文字起こし本体のNova-3が87パーセントで約0.0109ドル、専門用語を登録するKeyterm Promptingが13パーセントで約0.0016ドル。使わなければ0.0109ドル、使えば0.0125ドルになる
請求の内訳。文字起こし本体と機能ぶんは別に積まれる
項目割合金額日本円
Nova-3(録音済みの文字起こし)87%約$0.0109約1.7円
Keyterm Prompting(専門語の登録)13%約$0.0016約0.3円

文字起こし本体とは別に、使った機能のぶんが加算される。keytermを使わなければ$0.0109、使えば$0.0125。1本あたりの差は小さくても、本数が増えれば効いてきます。

Deepgramの公表単価は、2026年9月2日時点で次のとおり。録音済みとリアルタイムで単価が違います。

処理Nova-3 単一言語日本円Nova-3 多言語日本円
録音済みファイル$0.0043/分約0.7円/分$0.0052/分約0.8円/分
リアルタイム$0.0048/分約0.8円/分$0.0058/分約0.9円/分

1時間の会議を録音済みで処理するなら、$0.0043×60分=約$0.26。日本円で約42円です。

同じ会議を週2本、1年続けても$27前後=約4,300円にしかなりません。

新規アカウントにはUS$200、日本円で約32,000円ぶんの無料クレジットが付きます。公式料金ページの条件は3点。

  • クレジットカード不要
  • 最低利用額なし
  • 期限なし
Deepgramの管理画面に表示された残高。クレジットは199.99ドル、プランはPay As You Goと表示されている
2回処理したあとの残高。200ドルはほとんど減らない

個人のテストで200ドルを使い切るのは、まず起こりません。ただし、無料であることと上限管理が不要であることは別。

上の内訳のように機能ぶんが積み上がります。本格運用に移す前に、管理画面の消費量を月1回は確認してください。

料金は改定されます。使う前にDeepgramの公式料金ページで現行単価を確認するのが確実です。

4. 日本語の業務語は、事前準備なしでは任せにくい

精度も測りました。使ったのは、業務で間違えやすい21語をわざと入れた1分14秒の読み上げ音源です。稟議、決裁、按分、カスサク、石動という難読姓、雛形など。

結果は次のとおり。

条件正解した語正答率
用語を渡さない10/2148%
keytermで21語を渡す14/2167%

この48%は、日本語全体の正答率ではありません。間違えやすい語だけを21個選んだ意地悪なテストです。

日常語はおおむね読めていました。崩れたのは難読姓・社内略語・同音異義語に集中しています。

言えるのは、一般的な日本語は文になるが、自社固有の語は事前準備なしで任せにくいということ。

Nova-3には keyterm という機能があり、認識してほしい語を先に渡せます。コマンドではURLの末尾へ語数ぶん追加するだけ。

&keyterm=按分&keyterm=カスサク&keyterm=石動&keyterm=雛形

上限は1リクエストあたり500トークン。渡しすぎるより、実際に間違えた20語から始めるほうが現実的です。

効果と副作用(「笠原」が「笠原所」になるなど)や、PLAUD・OpenAIとの効き方の違いは別記事に。

文字起こしの辞書機能を3つのサービスで比べたに、21語すべての結果があります。

自分の用途で判断するなら、会社名・商品名・部署名・人名を入れた30秒の台本を作って測るのが最短です。

5. 録音済みはNova-3、音声エージェントはFlux

用途で分けるとシンプルです。

やりたいこと候補
録音済みの会議・インタビューを文字起こしNova-3
会議字幕をリアルタイム表示Nova-3
電話AIが人の発話終了を判断Flux
会話の割り込みを扱う音声エージェントFlux

Nova-3は汎用の音声認識モデルで、録音済みとリアルタイムの両方に対応。日本語は多言語対応に含まれ、language=ja で指定します。

Fluxは音声エージェント向けのリアルタイムモデルです。話し終わったか、割り込んだかという会話のターンを扱う設計。日本語は flux-general-multi で対応しています。

なお、医療特化の nova-3-medical は英語のみ。日本語の医療音声に特化したモデルではありません。

この記事で実測したのはNova-3の録音済み処理だけです。Fluxの日本語応答速度は、この結果からは判定できません。保存済みの音声から始めるならNova-3を選んでください。

6. 音声データを送る前に確認する3点

無料で動いたからといって、すぐ実データに切り替えないでください。確認するのは最低3点です。

mip_opt_out=true を意図して選ぶ

各リクエストに mip_opt_out=true を付けると、そのデータをModel Improvement Programから除外できます。

除外したリクエストのデータは、処理に必要な期間のみ保持されるという公式説明です。

2026年3月5日以降、Pay As You GoとGrowthはプログラムへの参加有無で公開料金が変わりません。曖昧にせず、リクエストで明示してください。

日本語の個人情報は自動の赤塗りに任せない

DeepgramにはRedaction(赤塗り)機能があります。ただし氏名・住所・病名などを認識するエンティティ赤塗りは、公式ドキュメント上で英語のみ

数字の赤塗りは録音済みなら全対応言語で使えます。それでも、日本語の氏名や病名が自動で消えるとは考えないでください。

医療・人事・顧客対応の音声は、実データを入れる前に組織の規程と契約を確認。公開できる架空音声で試すのが先です。

APIキーと課金を管理する

キーが漏れると、別の人がそのキーで利用できます。コマンド履歴・共有フォルダ・画面キャプチャに残さない運用が必要です。

本格運用では、権限を絞ったキーを使い、不要になったキーは失効させます。テスト用と本番用のプロジェクトを分けると管理しやすくなります。

最初のテストは、個人情報のない10秒音声で。これなら精度・操作・課金の3つを小さく確かめられます。

7. Deepgramが向く人、向かない人

判断基準は、精度より先に「完成した画面が欲しいか、続きを自分で決めたいか」の一点です。

向く人

  • Claude CodeやChatGPTに、普段から作業を頼んでいる人
  • 文字起こしのあとの要約・整形を、自分の形に決めたい人
  • 毎日、同じ手順で複数の音声を処理する人
  • 月額プランより、処理した時間に応じて払いたい人
  • 社内のフォルダや顧客管理ツールへ、そのまま流したい人

向かない人

  • スマホで録音し、ボタン1つで文字起こししたい人
  • 要約・議事録・共有ページを、契約したその日から使いたい人
  • コマンドを1度も実行したくない人
  • データ保存・学習利用・アクセス権限の設計を自分たちで行えない組織
  • 日本語音声の氏名や病名が自動で完全に消えることを前提にしたい人

会社として完成SaaSを選ぶなら、法人向けAI議事録サービス8選のように、会議基盤・管理機能・保存・料金を含めて比べる必要があります。

すでにAIエージェントへ日常的に仕事を頼んでいて、録音だけ別のサービスに預けているなら、試す価値があります。10秒の架空音声とコマンド1回で、相性は判断できます。

まとめ:続きを預けるか、自分で決めるか

  • Deepgramは完成SaaSではなく、文字起こしだけを返すAPI。続きは自分のAIエージェントに任せる
  • 日本語のNova-3は、プログラムを書かずコマンド1回で動いた
  • 1分14秒×2回の実測で$0.0125=約2円。1時間の会議なら約42円。うち13%はkeytermの追加ぶん
  • 難語21語の正答は10語、keytermを渡して14語。自社固有の語は事前準備が要る
  • 個人情報を含む日本語音声は、mip_opt_out=trueと契約条件を確認し、自動の赤塗りだけに任せない

録音を1本ずつ手で処理するなら、SaaSのほうが簡単です。同じ処理を繰り返し、そのままAIへ続きを頼みたいならDeepgramの出番。

すでにAIエージェントに仕事を任せているなら、文字起こしだけを別のサービスに預ける理由は、あまり残りません。

よくある質問

プログラミングができなくても使えますか?

最初の1回はコマンドを1行実行するだけです。公式ドキュメントが録音済み音声の手順にcURLを用意しています。普段Claude CodeやChatGPTに作業を頼んでいるなら、そのコマンド自体をエージェントに書かせても構いません。返ってくるのはJSONというデータの形なので、読みやすい議事録に整える工程は、そのままエージェントに続けて頼めます。

日本語に対応していますか?

対応しています。Nova-3の多言語対応に日本語が含まれていて、リクエストに language=ja と指定します。指定しない場合の既定値は英語なので、日本語音声を送るときは必ず付けてください。音声エージェント向けのFluxも flux-general-multi で日本語に対応しています。

無料でどこまで使えますか?

新規アカウントに200ドル、1ドル160円の換算で約32,000円ぶんの無料クレジットが付きます。クレジットカードの登録は不要、最低利用額なし、期限なしという条件です。1分14秒の音声を2回処理した私の実測では0.0125ドル、日本円で約2円しか減らなかったので、個人のテストで使い切ることはまず起こりません。

1時間の会議を文字起こしすると、いくらかかりますか?

録音済みファイルをNova-3の単一言語で処理する場合、2026年9月2日時点の公表単価は1分あたり0.0043ドルです。1時間なら約0.26ドル、1ドル160円の換算で約42円。同じ会議を週2本、1年続けても27ドル前後、日本円で約4,300円の計算になります。ただし専門用語を登録するkeytermなどの機能を使うと、その分が別に加算されます。

社内の会議音声をそのまま送っても大丈夫ですか?

先に確認することがあります。各リクエストに mip_opt_out=true を付ければモデル改善プログラムからデータを除外できますが、氏名や病名を自動で伏せるエンティティ赤塗り機能は公式ドキュメント上で英語のみの対応です。日本語の個人情報が自動で消えるとは考えず、まず個人情報を含まない架空音声で試してください。