ビジョン、PDF & ファイル入力
- なぜ Claude はマルチモーダルなのか:画像とドキュメントを1つのメッセージに
- ファイルを送る3つの方法:Base64、URL、Files API
- コストと時間を節約するために file_id でアップロードを再利用するとき
- ビジョンが得意なこと——抽出、視覚的理解、ドキュメント Q&A
- 安全に使う方法:解像度の上限と、重要な数値の検証
Claude はマルチモーダルです:メッセージに画像とドキュメント(PDF など)を含め、それについて質問できます——データを抽出する、チャートを説明する、契約書を要約する、スクリーンショットを読む。
ファイルを送る3つの方法
Guided walkthrough1 of 3
- バイトをリクエストにインラインでエンコードします。単発に最もシンプル。
- ホストされたファイルを指し示します。
- 一度アップロードし、その後多くのリクエストで file_id で参照します(大きなファイルの再アップロードを避けられます)。
テキストの質問と並ぶ画像コンテンツブロックは次のようになります:
# Conceptual: an image content block alongside text (see docs for exact fields)
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {"type": "base64", "media_type": "image/png", "data": b64}},
{"type": "text", "text": "What does this chart show? Give the top 3 takeaways."},
],
}]
PDF も同様に動作します(ドキュメントコンテンツブロック);Claude はテキストと視覚的レイアウトを読めて、答えがドキュメントのどこから来たかへ戻る引用を要求できます。
何に向いているか
- 抽出 — 請求書、フォーム、表から構造化データを引き出す(構造化出力と組み合わせる:/docs/api/structured-output)。
- 視覚物の理解 — チャート、図、スクリーンショット、UI。
- ドキュメント Q&A — 長い PDF をまたいで引用付きで質問する。
ドキュメント Q&A の手早いコピペ用スターター:
ドキュメント Q&A プロンプト
What does this chart show? Give the top 3 takeaways.
コツ
- 同じ大きなドキュメントを繰り返し送るときは file_id で再利用する — より安く速い。
- 解像度/サイズが効く — 非常に大きな画像は縮小されうる;上限を確認する。
- 抽出した数値を検証する — ビジョンは強力だが万能ではない;重要な数字はスポットチェックする。
- ビジョンは強力だが万能ではない — 重要な数字は必ずスポットチェックする。ハルシネーションを参照:/docs/foundations/hallucinations。
理解度チェック
0/3次へ
- 構造化出力
- 実ファイルの生成(docx/pptx/xlsx/pdf)
- トークン & 料金 — 画像もトークンを消費する