PR 本ページはプロモーション(アフィリエイト広告)を含みます。
[検証]Gemini 3.5 Transcribeの日本語精度は?逐語モードの注意点と、分割すべき音源の長さ
目次
Gemini 3.5 Transcribeの逐語モードは、原文どおりに書きません。一言一句そのままを文字にするモードと、読みやすく整えるモードがあります。
同じ音声を両方に投げたところ、逐語モードのほうが、原文から離れました。2026年8月26日に発表された、Googleの文字起こし専用モデルでの実測です。
料金は1分あたり0.005ドル、1時間の会議で約48円です(1ドル160円で換算)。私はこの記事の検証すべてで約1.35ドル、約220円を使いました。
無料の枠でも試せます。課金の前後で同じ音源を投げたところ、返ってきたテキストは1文字も違いませんでした。
有料にして変わるのは精度ではなく、レート制限とデータの扱いだけです。精度を上げたくて課金する必要はありません。
精度より先に、知っておくことがあります。60分近い音声を投げると、1文字も返ってこないことがあります。それでもエラーは出ません。
書いた人 サトシ 文字起こしサービスとAIレコーダーをたくさん検証している人
会議と記録に追われている非エンジニアです。音声入力や文字起こしAI、そして文字起こしを要約してくれるAIを使い倒したら、日々の業務がめっちゃ楽になりました。 その手応えから、文字起こしサービスもAIレコーダーも自腹で契約・購入し、同じ音源を入れて結果を見比べています。 音声入力は Aqua Voice を日常的に愛用し、議事録要約の NotebookLM は仕事でもプライベートでも1年以上活用中。 個人情報を扱う仕事柄、セキュリティや運営元の素性は人一倍シビアにチェックします。 このサイトは、その実測ログの置き場です。
先に、この記事の答えを4つ。
- 逐語モードが誤り、整形モードが正しく書いた語がある(→逐語と整形)
- 50分を超えると出力が壊れる。エラーは出ない(→長さの壁)
- 用語リストは効く。ただし直るのは表記だけ(→専門用語の正答率)
- 話者分離をオンにすると精度が落ち、直す手段がなくなる(→話者分離の代償)
この記事で使うものは次の4つ。
- Google AI Studioで発行するAPIキー
- 文字起こししたい音声ファイル(18MB以下ならそのまま送れる)
- ターミナル、または短いPythonスクリプト
- 無料または有料の枠(どちらでも出力は同じ)
順に、逐語と整形の違い → 長さの壁 → 再現性 → 専門用語 → 話者分離 → 料金、で見ていきます。
1. 逐語モードのほうが、原文から離れた
同じ音声を2つのモードに投げると、逐語モードだけが言葉を間違えました。
このモデルには出力の形式が2つあります。話された内容をそのまま文字にするverbatim(逐語)と、フィラーを消して読みやすく整えるsmart(整形)です。
既定は逐語のほうになっています。
正確さを求めるなら逐語を選ぶ。そう考えるのが自然だと思います。
私は2026年7月に、ブラウザのGeminiで同じ音源を文字起こししました。
そのとき「海沿いのカフェ」という台本の一節が、「水辺」や「湖畔」に化けています(Geminiの文字起こしを検証した記事にまとめました)。
その音源が手元に残っています。今回は同じ音を、APIの2つのモードに投げました。
| 出力 | 「海沿いのカフェ」がどう書かれたか |
|---|---|
| 台本(正解) | 海沿いのカフェ |
| 7月・ブラウザの要約 | 海沿いのカフェ |
| 7月・ブラウザの全文書き起こし | 水辺のカフェ |
| 7月・生成されたPDF | 湖畔のカフェ |
| 今回・逐語モード | 水辺のカフェ |
| 今回・整形モード | 海沿いのカフェ |
7月にブラウザで起きたことが、公式の逐語モードでも起きました。
一言一句そのままを求めた出力ほど、原文から離れる。この現象は、モデルの世代が変わっても、専用モデルになっても残っています。
なお7月に欠けた「第3クォーターのKPI」は、今回はどちらのモードでも正しく出ました。ここは改善しています。
逐語モードを選んだから正確、とは考えないでください。まず短い音声で1回投げて、聞き取れている語と外している語を見てから本番の音源を送ります。
2. 整形モードは、言葉そのものを置き換える
整形モードが直すのは、話し方だけではありません。語そのものを別の語に替えます。
同じ音源で、2つのモードの出力を並べました。
| 台本にあった要素 | 逐語モード | 整形モード |
|---|---|---|
| フィラー(えっと、え、) | 残る | 消える |
| 午後、午前10時(言い直し) | そのまま | 午前10時 |
| 金曜、金曜日までに | そのまま | 金曜日までに |
| バジェットの上限 | バジェット | 予算 |
| BtoBのサービス | サービス | SaaS |
| 1番の肝 | 1番 | 一番 |
| 段落分け | なし | 入る |
上の3行は、フィラーの除去と言い直しの整理です。会議の記録としてはむしろ読みやすくなります。
問題はその下です。「バジェット」と話したのに「予算」と書かれる。
これは言い直しの解決ではなく、言い換えです。
文字数は逐語が892字、整形が857字でした。35字ぶんが消えた計算になります。
整形モードは議事録には向きますが、逐語の記録には使えません。
自分の用途がどちらかを決めてから、モードを選んでください。判断がつかないうちは、まず両方で1回ずつ出して読み比べるのが早いです。
3. 50分を超えると壊れる。エラーは出ない
60分近い音声を投げると、テキストが1文字も返ってきませんでした。
しかもエラーは一切出ません。HTTP 200、状態は completed。成功として返ってきます。
私は2種類の音源で測りました。同じ台本を繰り返しただけの音声と、外部の講演を録音した実際の音声です。この2つで、壊れ方がまったく違いました。
実際の音声:55分までは正常、60分で空になる
日本語の話し声は、おおよそ毎分280字から300字です。これを物差しにすると、55分までは妥当な量が返っています。
| 音声の長さ | 返ってきた文字数 | 1分あたり | 判定 |
|---|---|---|---|
| 10分 | 3,044字 | 304字 | 正常 |
| 30分 | 8,633字 | 288字 | 正常 |
| 45分 | 12,755字 | 283字 | 正常 |
| 55分 | 15,407字 | 280字 | 正常 |
| 59.9分(1回目) | 0字 | — | 空 |
| 59.9分(2回目) | 0字 | — | 空 |
59.9分は2回とも0字でした。たまたま失敗したわけではありません。
音声そのものは読み込まれています。入力トークンは89,879と記録されていて、長さに比例した量です。壊れているのは出力側だけでした。
繰り返しの多い音声:30分で6倍に膨らむ
同じ台本を繰り返した音源では、別の壊れ方をしました。理論上の周回数より、はるかに多い量が返ってきます。
| 音声の長さ | 本来の周回数 | 返ってきた周回数 | 倍率 |
|---|---|---|---|
| 10分 | 3.6周 | 4周 | 1.12倍 |
| 30分 | 10.8周 | 65周 | 6.04倍 |
| 60分(1回目) | 21.5周 | 67周 | 3.11倍 |
| 60分(2回目) | 21.5周 | 44周 | 2.05倍 |
30分の時点で6倍です。読めば同じ話の繰り返しだと分かりますが、それらしい日本語なので、開いた瞬間には気づきません。
7月のブラウザ版とは、逆向きに壊れた
7月にブラウザのGeminiで同じ長さの音源を試したときは、逆でした。
60分の音声で、21.5周の繰り返しを「10回から15回」としか認識していません。足りない方向に外れています。
今回のAPIは、同じ長さで67周と答えました。多すぎる方向に外れています。
足りないか、多すぎるか。向きは違いますが、共通しているのはどちらも成功として返ってくることです。
成否を判定できる手がかりが、応答の中にない
応答にはusage.total_output_tokensという値が入っています。出力の量を表すフィールドです。
これが全ケースで0でした。正常に返ってきた10分や30分の分でも0です。この数字で成功したかどうかを判定することはできません。
確かめる方法は、テキストの中身を見ることだけです。
50分を超えたら分割する。これが今日から使えるルールです。手持ちの録音が1時間を超えているなら、まず前半だけ切り出して1回投げてみてください。
4. 同じ音声を3回投げると、同じ結果が返るか
短い音声は完全に一致しました。長い音声は一致しません。
同じ入力に同じ出力が返るかどうかは、文字起こしを仕事で使ううえで効いてきます。あとから読み返した記録が、前に読んだものと違っていたら困るからです。
167秒の音源で3回ずつ試しました。
| 条件 | 結果 |
|---|---|
| 逐語モード ×3回 | 完全一致 |
| 整形モード ×3回 | 完全一致 |
整形モードも一致しました。読みやすく整える処理が入っても、同じ音声なら同じ結果になります。
一方、60分の音源では2回で文字数が2万字違いました。58,443字と38,584字です。周回数も67周と44周で食い違っています。
私は以前、PLAUDとOpenAIのAPIで同じ検証をしました。
PLAUDは3回とも違う結果を返し、APIは3回とも完全に一致しています(PLAUDの音声をAPIで文字起こしした記事)。
今回、そこに3つ目の型が加わりました。
- 毎回変わる(PLAUDの自動処理)
- 必ず同じ(APIに短い音声を投げた場合)
- 短ければ同じ、長いと変わる(Gemini 3.5 Transcribe)
「APIだから毎回同じ結果になる」とは言い切れません。同じ音源をもう一度投げ直す前に、その音源が50分以内かどうかを見てください。
5. 専門用語は21語中17語まで直せた
用語リストを渡すと、正答率は62%から81%に上がりました。APIとしては最も高い数字です。
社内の固有名詞や業界用語が化けるかどうかは、実務で使えるかを分ける条件になります。私は業務でよく出る21語を台本に入れた音源で、同じ採点を続けています。
| 条件 | 正答 | 正答率 |
|---|---|---|
| Gemini 3.5 Transcribe(リストなし) | 13語 | 62% |
| Gemini 3.5 Transcribe(リストあり) | 17語 | 81% |
| gpt-transcribe(リストあり) | 15語 | 71% |
| PLAUD(用語登録あり) | 18語 | 86% |
| gpt-4o-transcribe(リストあり) | 11語 | 52% |
注目したいのは、リストを渡す前の62%です。他のAPIがリストを渡したあとの数字に迫っています。何も準備しない状態でも、日本語の業務語をかなり拾えます。
直る語と、直らない語がはっきり分かれた
用語リストで直ったのは4語でした。稟議、一時半、粗利、石動。いずれも読みは合っていて表記だけが違ったものです。
直らなかったのも4語あります。
| 正解 | リストありでどうなったか | 種類 |
|---|---|---|
| 決裁 | 決済 | 同音異義語 |
| 補償 | 消える | 語の脱落 |
| 棚卸 | 棚卸し | 送り仮名 |
| 所要工数 | 工数 | 語の脱落 |
同音異義語、送り仮名、語の脱落。この3種類は、リストに入れても直りませんでした。
同じ検証を3つのサービスで行った結果は、文字起こしの辞書機能を3つのサービスで比べた記事にまとめています。
英字の略語は、他のAPIより直せた
ROIとASAPが直りました。これは他のAPIでは直せなかった語です。
| 語 | リストなし | リストあり |
|---|---|---|
| ROI | ROE | ROI |
| ASAP | SAP | ASAP |
| PoC | COP | COP |
| SaaS | 正解 | 正解 |
| MTG | 正解 | 正解 |
gpt-transcribeは同じリストを渡してもROIとASAPを3回とも直せませんでした。ここは明確な差です。
ただしPoCは直りません。音の並びが入れ替わるタイプは苦手なようです。
リストの表記が、そのまま出力の表記になる
副次的な発見がありました。リストに「二十一日の十時半」と漢数字で書いたところ、出力も漢数字になりました。リストなしでは「21日の10時半」です。
用語リストは、読みを直すだけの機能ではありません。表記の指定としても働きます。社内文書の表記ルールが決まっているなら、その表記で登録してください。
まずは自社で必ず出る語を10語ほど書き出すところから始められます。
6. 話者分離をオンにすると、精度が落ちる
誰が話したかを分けようとすると、何を話したかが崩れました。
話者分離と単語タイムスタンプを付けて、同じ音源を投げた結果です。
| 語 | 通常 | 話者分離とタイムスタンプあり |
|---|---|---|
| 定例 | 定例 | テレ |
| 笠原 | 笠原 | 必ず |
| 与信 | 与信 | 余震 |
| 粗利 | アライ | 有 |
通常なら正しく書けていた「定例」「笠原」「与信」が、揃って崩れました。
タイムスタンプ自体は正常に返ってきます。単語ごとの時刻が200個、話者の判定も正しく出ました。壊れているのは文字起こしの中身のほうです。
そして、これを直す手段がありません。
公式の仕様で、用語リストは話者分離やタイムスタンプと同時に使えないと決まっています。整形モードも同様に併用できません。
| 組み合わせ | 可否 |
|---|---|
| 整形モード × 話者分離・タイムスタンプ・用語リスト | 使えない |
| 用語リスト × 話者分離 | 使えない |
| 用語リスト × タイムスタンプ | 使えない |
つまり精度が落ちる条件でだけ、精度を上げる手段が封じられます。
誰が喋ったかを知ろうとすると、何を喋ったかが崩れます。
会議の記録で発言者を分けたいなら、この代償を織り込んでください。多くの場合、話者分離をオフにして用語リストを使うほうが、読める記録になります。
7. いくらかかって、結局どれを使えばいいのか
1時間の会議で約48円。他のAPIと比べても同程度です。
今回の検証で使った約1.35ドルの内訳は、短い音源を約20回で0.25ドル、10分から60分の長時間テストを5回で1.10ドル。
60分を3回投げた分が、費用の大半を占めています。
| サービス | 1分あたり | 1時間あたり |
|---|---|---|
| Gemini 3.5 Transcribe | 0.005ドル | 約48円 |
| OpenAI gpt-transcribe | 0.0045ドル | 約43円 |
| Deepgram Nova-3 | 0.0043ドル | 約42円 |
金額はどれも同程度です。1時間で50円前後。ここで迷う必要はありません。単価は2026年9月7日時点のもので、為替は1ドル160円で計算しています。
日本語での実測を並べた記事は、Deepgramで日本語を文字起こしにあります。
リアルタイム用のgemini-3.5-transcribe-liveも用意されています。
ただしWebSocketで繋ぐ必要があり、コマンド1回では終わりません。手元に音声ファイルがあるなら、こちらは使わなくて構いません。
あなたが使うべきものは、どれか
APIを自分で叩ける、またはAIエージェントに任せられるGemini 3.5 Transcribeで問題ありません。日本語の業務語に強く、用語リストの効きも良好です。50分で切ることだけ守ってください。
コマンドは書かないが、文字起こしはしたいAPIではなく、画面から使えるサービスを選んでください。文字起こしツールの選び方に用途別の候補をまとめています。
そもそも、録音する道具がないここが先です。APIは音声ファイルがあって初めて使えます。1分0.005ドルがどれだけ安くても、録れていない会議は文字にできません。
会議のあとで「あの数字、いくらだったか」を思い出せなかったことがあるなら、録る道具を持つところからです。
文字起こしをやり直せるのは、音声が残っている人だけの選択肢になります。
録った音声はあとから何度でも文字起こしをやり直せる
PLAUD Note を公式サイトで見るまとめ
Gemini 3.5 Transcribeを有料の枠で測った結果です。
- 逐語モードは原文どおりを保証しない。整形モードのほうが正しく書いた語がある
- 整形モードは語そのものを置き換える(バジェット → 予算)。逐語の記録には使えない
- 50分を超えると出力が壊れる。59.9分は2回とも0字だった
- 繰り返しの多い音声は30分で6倍に膨らむ
- 壊れてもHTTP 200で返る。出力トークン数も0のまま。中身を見るしかない
- 用語リストは62%から81%に効く。ただし直るのは表記だけ
- 英字の略語はROIとASAPが直る。他のAPIより強い
- 話者分離を使うと精度が落ち、用語リストで補えない
日本語の精度は、今のところAPIの中で最も高い部類です。それでも、返ってきたテキストが音声の長さに見合っているかを確認する工程は省けません。
長い録音を持っているなら、まず45分で切るところから始めてください。
よくある質問
逐語モードと整形モード、どちらを選べばいいですか?
読める記録が欲しいなら整形モード(smart)です。フィラーが消え、言い直しが整理され、段落も付きます。ただし整形モードは「バジェット」を「予算」に置き換えるなど、話された語そのものを別の語にすることがあります。発言をそのまま残す必要がある場面では逐語モード(verbatim)を選び、そのうえで書き起こしを音声と突き合わせてください。逐語モードなら原文どおりという保証はありません。
1時間の会議を文字起こしすると、いくらかかりますか?
録音済みの音声を処理する単価は1分あたり0.005ドルです。1時間なら0.3ドル、1ドル160円の換算で約48円になります。ただし1時間の音声は1回で送らず、50分以下に分けて送ってください。私の実測では59.9分の音声が2回とも1文字も返らず、それでも入力ぶんの料金は発生しました。
長い録音は、どう分割すればいいですか?
45分から50分を上限にして区切ります。会議の切れ目に合わせる必要はなく、時間で機械的に切って構いません。文字起こしのあとにテキストを繋げば元に戻ります。同じ議題や決まった文言が何度も出てくる録音は、30分の時点で内容が水増しされた例があるため、さらに短く切ってください。
エラーが出ていなければ、成功と考えていいですか?
いいえ。壊れた出力もHTTP 200と completed で返ってきます。応答に含まれる出力トークン数も、正常なときを含めてすべて0だったため、成否の判定には使えません。日本語の話し声はおおよそ毎分280字から300字なので、返ってきた文字数を音声の分数で割り、その範囲から大きく外れていないかを確認してください。
話者分離は使わないほうがいいですか?
誰の発言かを機械的に分ける必要がないなら、オフのままにしてください。話者分離と単語タイムスタンプを付けた条件では、通常なら正しく書けていた語が崩れました。さらに公式の仕様上、話者分離と用語リストは同時に使えません。精度が落ちる条件で、精度を上げる手段が使えなくなります。
無料のまま試しても、結果は同じですか?
出力は同じです。課金前と課金後に同じ音源を投げたところ、返ってきたテキストは完全に一致しました。違うのはレート制限と、送ったデータの扱いです。無料の枠は送信内容が製品改善に使われる規約なので、業務の録音を試すときは有料の枠を使うか、個人情報を含まない音声で確かめてください。