ChatGPTで、録音した音声ファイルをそのままアップロードして、文字起こしや要約ができるようになりました。OpenAIは2026年10月6日付のリリースノートで「Audio uploads in ChatGPT」を公開し、日本でも10月9日にITmedia NEWSやImpress Watchが報じています。
ポイントをまとめます。
- 音声ファイルのアップロードは有料プランとワークスペースで利用でき、無料プランでは現時点で使えません
- 対応形式はMP3、M4A、WAV、AAC、FLAC、OGG、音声のみのMP4・WebMなど
- 1ファイルあたり最大512MB。録音時間の上限は明記されていませんが、長い録音は分割処理され、タイムアウトすることもあります
- 使い方は、チャットに音声ファイルを添付して「文字起こしして」「要約して」と指示するだけです
この記事では、できること、使えるプラン、対応形式と制限、具体的な手順とプロンプト例、うまくいかないときの確認ポイントを順に整理します。
ChatGPTの音声ファイル対応で何ができるようになったのか
これまでは、録音済みの音声ファイルを通常のChatGPTのチャット画面で直接文字起こしすることは難しく、外部の文字起こしツールなどを利用する方法が一般的でした。
今回の対応で、録音済みのファイルをチャットに添付するだけで、ChatGPTが音声の中身を理解して作業できるようになりました。OpenAIのヘルプ記事では、主な用途として次のようなものが挙げられています。
- 録音の文字起こし(トランスクリプト)の作成
- 録音内容の要約
- 録音の内容についての質問(「〇〇さんは何と言っていた?」など)
- インタビューや講義からの重要事項の抽出
- 会議の振り返りメモ、構造化されたノートの作成
- 会議後のフォローアップメールの下書き
文字起こしをしたうえで、同じチャットの中で「決定事項だけ抜き出して」「メールにして」と続けて頼めるのが、専用の文字起こしツールとの大きな違いです。
使えるプランと使えないプラン
OpenAIのヘルプ記事では、音声のアップロードは「有料のChatGPTサブスクリプションとワークスペース(Enterpriseを含む)」で利用できるとされています。一方、無料プランについては「現時点では利用できない」と明記されています。
| プラン | 音声ファイルのアップロード |
|---|---|
| 無料(Free) | 利用不可(現時点) |
| 有料の個人プラン(Plus、Proなど) | 利用可 |
| ワークスペース(Business、Enterprise、Eduなど) | 利用可(管理者の設定による) |
なお、ヘルプ記事には個別のプラン名の一覧はなく、低価格プランの「ChatGPT Go」が対象かどうかは明記されていません。また、利用可否は「ワークスペースの設定、地域、アプリのバージョン、選択しているモデル」によって変わる場合があるとされています。有料プランを契約しているのに使えない場合は、後述の確認ポイントを試してください。
各プランの料金や違いは「ChatGPT料金プラン完全比較」で詳しく解説しています。
対応ファイル形式と容量制限
公式ヘルプに記載されている対応形式と制限は次のとおりです。
| 項目 | 内容 |
|---|---|
| 対応形式 | WAV、MP3/MPEG、OGG/OGA、音声のみのWebM、PCM、FLAC、AAC、M4A、音声のみのMP4 |
| 非対応 | 動画として認識されるMP4・WebM |
| 最大サイズ | 1ファイルあたり512MB |
| 録音時間の上限 | 明記なし(長い録音は分割処理され、非常に長いとタイムアウトする場合あり) |
| アップロード回数 | ファイル全般で3時間あたり80ファイルまで(混雑時は引き下げられる場合あり) |
注意したいのは、拡張子がMP4やWebMでも、映像を含む「動画ファイル」は対象外という点です。ファイルの中に正しく読み取れる音声データが入っている必要があります。
スマホの録音やWeb会議の録画は使える?
iPhoneのボイスメモはM4A形式で保存されるため、そのまま添付できる形式です。Androidの録音アプリやICレコーダーも、MP3・M4A・WAVで保存するものが多く、形式としては対応範囲に入ります。
一方、Web会議ツールの録画データは映像付きのMP4であることが多く、動画として扱われると受け付けられません。Zoomのローカル録画のように音声だけのファイル(M4A)も同時に保存できるツールでは、そちらを使うのが確実です。音声のみのファイルがない場合は、動画編集アプリや変換ツールで音声だけを書き出してから添付してください。
ChatGPTで音声ファイルを文字起こしする手順
使い方はほかのファイルを添付するときとほぼ同じです。
- ChatGPTをWebブラウザまたは最新版のアプリで開き、新しいチャットを始めます
- 入力欄の「+」(ファイル添付)から音声ファイルを選ぶか、ブラウザではファイルを入力欄にドラッグします
- 「この音声を文字起こししてください」など、やってほしいことを入力して送信します
- 結果を確認し、必要に応じて「要約して」「表にまとめて」などと追加で指示します
すぐ使えるプロンプト例
指示を具体的にすると、出力をそのまま使いやすくなります。
- 「この音声を日本語で文字起こししてください。話し手が変わるところで改行し、『話者A』『話者B』のように区別してください。」
- 「この会議の録音を要約し、『決定事項』『ToDo(担当者・期限)』『持ち越し事項』に分けて整理してください。」
- 「このインタビュー音声から、〇〇について話している部分だけを抜き出してください。」
- 「講義の録音から重要なポイントを5つ挙げ、復習用の確認問題を3問作ってください。」
- 「この打ち合わせの内容をもとに、取引先へ送るお礼とフォローアップのメール文面を作成してください。」
社名や製品名、専門用語が多い録音では、「登場する固有名詞:〇〇、△△」のように事前に伝えておくと、表記ゆれや誤変換を減らせます。
精度と注意点
OpenAIは、文字起こしの結果に誤りが含まれる可能性があり、話者の識別も正確でない場合があると注意書きしています。また、音声の理解や文字起こしの性能は言語によって異なる可能性があるとしています。日本語の録音でも十分使える場面は多いと考えられますが、次の点には気をつけましょう。
- 金額、日付、数量などの重要な数字は、元の音声で必ず確認する
- 雑音が多い場所や、複数人が同時に話している部分は誤りが出やすい
- 「話者A・B」の区別はあくまで推定なので、議事録として配布する前に人の目で確認する
- 長時間の録音は、処理が分割されたり、タイムアウトしたりする場合がある
- 処理がうまくいかない場合は、音声ファイルを短く分割してアップロードする方法もある
特に、要約は文字起こしに誤りがあると内容がずれることがあります。正式な議事録や記事の引用に使う場合は、全文の文字起こしを出してもらい、必要な箇所を音声と突き合わせるのがおすすめです。
音声ファイルが添付できない・使えないときの確認ポイント
「添付ボタンから音声を選べない」「アップロードしてもエラーになる」という場合は、次の順に確認してください。
- 無料プランで使っていないか:無料プランでは現時点で音声アップロードは使えません
- アプリやブラウザが最新か:アプリのバージョンによって利用可否が変わるとされています。アプリを更新するか、Web版で試してください
- ファイル形式は対応しているか:動画として認識されるMP4・WebMは対象外です。音声のみのファイルに変換してください
- 512MBを超えていないか:超える場合は、ビットレートを下げたMP3に変換するか、ファイルを分割します
- ワークスペースの設定:会社や学校のアカウントでは、管理者の設定で使えない場合があります
- 混雑時間帯ではないか:アップロードの上限は混雑時に引き下げられることがあります。時間をおいて再度試してください
それでも使えない場合は、段階的に提供されている可能性もあるため、数日おいて再確認するとよいでしょう。
Record(記録)機能との違い
ChatGPTには、以前から会議などをその場で録音して文字起こし・要約する「Record」機能もあります。公式ヘルプをもとに、今回の音声アップロードとの違いを整理します。
| 項目 | 音声ファイルのアップロード | Record(記録) |
|---|---|---|
| 使い方 | 録音済みのファイルを添付 | ChatGPTアプリでその場で録音 |
| 主な対象 | ボイスメモ、ICレコーダー、会議の録音ファイルなど | 進行中の会議、打ち合わせ、音声メモ |
| 対応環境 | Web版と対応するモバイルアプリなど | ヘルプ記事ではmacOSデスクトップアプリ |
| 長さの目安 | 上限の明記なし(長いと分割・タイムアウトの可能性) | 1セッション最大4時間 |
| 結果 | チャット内で文字起こし・要約・質問 | 要約がキャンバスとして保存される |
これから行う会議を記録したいならRecord、すでに手元にある録音ファイルを処理したいなら音声アップロード、と使い分けるとよいでしょう。Gemini、Microsoft Copilot、Claudeなどほかの生成AIの文字起こし手段との比較は「生成AIで音声・会議を文字起こしする方法|ChatGPT・Gemini・Copilot・Claudeを比較」で解説しています。
プライバシーと業務利用での注意点
会議や取材の録音には、個人情報や社外秘の情報が含まれることが少なくありません。アップロード前に次の点を確認しておきましょう。
- 個人向けプラン:アップロードした内容がモデルの改善に使われるかどうかは、データ設定(「すべての人のためにモデルを改善する」など)によって決まります
- 法人向けプラン:OpenAIは、ChatGPT EnterpriseやAPIなどのビジネス向けサービスに送信された内容をモデルの性能改善に使わないとしています
- ファイルの保存:ライブラリに保存されたファイルは、チャットを削除しても自動では消えません。不要になったファイルは個別に削除してください
- 録音の同意:会議の参加者や取材相手に、録音とAIでの処理について事前に了承を得ておくと安心です
各サービスの学習利用の設定方法は「生成AIの入力データは学習に使われる?ChatGPT・Claude・Gemini・Copilotのプライバシー設定を比較」をご覧ください。
まとめ
ChatGPTの音声ファイル対応により、ボイスメモや会議の録音をアップロードするだけで、文字起こしから要約、議事録やメールの作成までをひとつのチャットで完結できるようになりました。
- 利用できるのは有料プランとワークスペース。無料プランでは現時点で使えません
- MP3・M4A・WAVなど主要な音声形式に対応し、1ファイル最大512MB
- 動画ファイルは対象外なので、Web会議の録画は音声だけを書き出して使う
- 文字起こしには誤りが含まれる可能性があるため、重要な部分は元の音声で確認する
すでに有料プランを使っている方は、手元の短い録音で一度試してみて、精度や使い勝手を確かめてから会議の議事録作成などに活用するのがおすすめです。
