Skip to main content
支持 vision 的模型可以在一次请求里同时接收图片和文字。你可以把图片交给模型,让它描述画面、识别其中的文字(OCR)、看懂界面截图、流程图或图表,也可以从拍照的表格里把数据读出来。 底层用的还是和普通对话一样的 OpenAI 兼容端点。唯一变化的是 content 字段:不再传一个字符串,而是传一个由若干部分组成的数组 —— 文本块 {"type": "text"} 和图片块 {"type": "image_url"}
请使用支持 vision 的模型:Claude(Sonnet / Opus)、GPTGeminiGLM(GLM-5V) 都能接收图片。DeepSeek 只能处理文本 —— 见 DeepSeek 模型。发请求前,先在主站**「价格」**页面查看各模型的能力标签。

通过公开链接传图

最简单的情况 —— 图片已经在网上,有直接可访问的 URL。
Python (OpenAI SDK)

本地文件用 base64

如果图片无法公开访问(截图、磁盘上的照片),就把它编码成 base64,以 data:image/jpeg;base64,... 这种 data URI 形式传入。
Python (OpenAI SDK)
PNG 把前缀改成 data:image/png;base64,,WebP 用 data:image/webp;base64,。MIME 类型必须和文件的真实格式一致。

注意事项

图片会计入输入 token,分辨率越高,请求越贵。如果不需要看清细节,发送前先把图缩小(比如长边压到 1024–1568 px)。
base64 字符串比原文件大约大三分之一,而且整段都塞进请求体里。对于体积大的图片,用公开链接比传几兆字节的 data URI 更稳妥 —— 否则可能撞上请求体积上限。
通常是 jpegpngwebpgif。HEIC、TIFF、SVG 等冷门格式建议先转换成上述之一。

接下来