跳到主要内容

视觉、PDF 与文件输入

进阶
What you'll learn
  • 为什么 Claude 是多模态的:在一条消息中同时包含图片和文档
  • 发送文件的三种方式:Base64、URL 和 Files API
  • 何时通过 file_id 复用上传文件以节省成本和时间
  • 视觉能力擅长什么——数据抽取、视觉理解、文档问答
  • 如何安全使用:分辨率限制与核验关键数字

Claude 是 多模态的:你可以在一条消息中包含 图片和文档(如 PDF)并就此提问——抽取数据、描述图表、总结合同、读取截图。

发送文件的三种方式

Guided walkthrough1 of 3
  1. 将字节内联编码进请求。适合一次性场景,最简单。

下面是一个图片内容块与文本问题并列时的样子:

# Conceptual: an image content block alongside text (see docs for exact fields)
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {"type": "base64", "media_type": "image/png", "data": b64}},
{"type": "text", "text": "What does this chart show? Give the top 3 takeaways."},
],
}]

PDF 的用法类似(一个文档内容块);Claude 可以读取文本和视觉版式,你还可以请求返回 引用,指向答案在文档中的出处。

它擅长什么

Pro tip
  • 抽取——从发票、表单、表格中提取结构化数据(与结构化输出搭配:/docs/api/structured-output)。
  • 理解视觉内容——图表、示意图、截图、UI。
  • 文档问答——在一份长 PDF 上提问并带引用。

一个可快速复制粘贴的文档问答起步示例:

文档问答提示词

What does this chart show? Give the top 3 takeaways.

提示

Key takeaways
  • 当反复发送同一份大文档时,用 file_id 复用——更便宜也更快。
  • 分辨率/尺寸有讲究——非常大的图片可能被降采样;请查看上限。
  • 核验抽取出的数字——视觉能力很强但并非万无一失;对关键数字做抽查。
Watch out
  • 视觉能力很强但并非万无一失——始终对关键数字做抽查。参见幻觉:/docs/foundations/hallucinations。

自我检测

0/3
  1. 哪种方法可以让你只上传一次文件,然后在多个请求中通过 file_id 引用它?
  2. 在对 PDF 做文档问答时,你可以从 Claude 那里请求返回什么?
  3. 为什么应该对抽取出的关键数字做抽查?

下一步