文章摘要
DeepSeek的视觉模型支持图像与文本输入,可描述图片、提取截图文字、分析图表等。支持JPEG、PNG、GIF和WebP格式,提供三种图像输入方式,包括Base64编码内联、URL引用和文件上传,均兼容OpenAI格式。
文章总结
好的,这是根据您的要求,对原文进行中文重述后的版本:
标题:视觉能力 | DeepSeek API 文档
deepseek-v4-flash-vision-exp 模型能够同时处理文本和图像,因此您可以要求模型描述图片、识别截图中的文字、分析图表等。
支持的图片格式为:JPEG、PNG、GIF 和 WebP。格式检测基于文件的实际内容,而非文件名或声明的 MIME 类型。
发送图片
您可以通过三种方式向模型提供图片,它们都使用标准的 OpenAI 兼容的聊天补全格式,其中 content 是一个由多个内容块组成的数组,而非纯文本字符串。
基础 URL 为 https://api.deepseek.com。
1. Base64 编码图片(内联)
将图片编码后,以 data: URL 的形式直接嵌入请求中。这是处理本地文件最简单的方式。编码后的数据会计入 48 MiB 的请求体大小限制。
2. 外部图片 URL
提供一个可公开访问的 http(s) 链接,模型会自动下载该图片。URL 长度不得超过 8192 个字符,图片文件最大为 32 MiB,且下载必须在 60 秒内完成。如果链接过长,建议使用 Base64 数据 URL 或文件 API。
3. 引用通过文件 API 上传的文件
使用文件 API 上传一次图片,然后在请求中引用其 file_id。当您在多个请求中重复使用同一张图片,或图片大小接近 48 MiB 的内联限制时,这是最佳选择。通过文件 API file_id 引用的图片最大可达 64 MiB,且不受 32 MiB 的单张图片大小限制。
细节级别
对于 image_url 输入,您可以设置一个可选的 detail 字段来控制图片的处理方式:
low:图片在推理前会被缩小到 512×512。当不需要精细的视觉细节时,此选项更快、更经济。high:保留原始图片。original:保留原始图片。auto:自动选择,目前等同于original。
何时使用文件 API
内联图片(Base64 或 file_data)会计入 48 MiB 的请求体大小限制。在以下情况,建议考虑使用文件 API:
- 单个请求会超出请求体大小限制。
- 图片大于 32 MiB(只有通过文件 API 才能处理)。
- 您在多个请求中引用同一张图片,希望避免重复上传。
Token 用量
图片会根据其尺寸被转换为 token,并与文本 token 一起计费。
在推理前,每张图片都会被自动调整大小:
- 总像素数低于约 384×384 的图片会被放大,同时保持宽高比。
- 较大的图片会被缩小,同时保持宽高比,使得调整大小后的总像素数大致相当于一张 800×800 的图片。
因此,每张图片的 token 数上限为 384 个。例如,一张 2000×2000 的图片和一张 5000×5000 的图片在调整大小后消耗的 token 数相同。当请求中包含多张图片时,每张图片都独立按此规则计算。
限制
| 限制项 | 数值 |
| :--- | :--- |
| 支持的格式 | JPEG, PNG, GIF, WebP |
| 外部 URL 长度 | 8192 个字符 |
| 请求体大小 | 48 MiB |
| 单张图片最大尺寸(Base64 / 外部 URL) | 32 MiB |
| 单张图片最大尺寸(文件 API file_id) | 64 MiB |
| 每次请求最大图片数量 | 600 张 |
| 每次请求图片总大小上限 | 不含 file_id 图片时为 64 MiB;包含 file_id 图片时可达 200 MiB |
| 图片最大尺寸 | 单边 8192 像素;当请求中包含 15 张或更多图片时,降至单边 4096 像素 |
限制条件
- 图片仅在
user消息中支持:在system或assistant消息中包含图片会返回400错误。 - 只有视觉模型(
deepseek-v4-flash-vision-exp)能接受图片;其他模型会返回400错误。 - 包含保留图片占位符 token 的用户文本会被拒绝,并返回
400错误。
通过 Anthropic API 使用图片
除了上述 OpenAI 兼容的端点外,您还可以通过 Anthropic 兼容的 /messages 端点发送图片。区别在于图片内容块的格式不同:Anthropic 使用 image 块,其 source 对象的 type 可以是 base64、url 或 file。
通过响应 API 使用图片
deepseek-v4-flash-vision-exp 模型也支持通过 OpenAI 兼容的响应 API 接受图片。同样的三种输入方法和限制适用,只是内容部分的格式不同——图片通过 input_image 部分传递。input_image 部分支持 detail 字段,其语义与上述相同。
评论总结
根据评论内容,总结如下:
主要观点:
功能升级与改进(多数认可):
- 评论1指出,DeepSeek v4 Flash 0731曾错误假设具备视觉能力,导致虚构图像分析工具,新版本解决了此问题。
- 评论7祝贺模型“终于有了眼睛”,认为黑暗时期即将过去。
- 评论8表示,因需要图像输入,曾被迫使用Opus 4.6,现在DS支持视觉功能是重大利好。
分辨率限制与实用性(存在争议):
- 评论2认为,图像缩放至800×800像素对OCR等应用分辨率不足,需更高(如A4纸大小)。
- 评论6指出,800×800(0.64MP)低于1995年SVGA标准(0.79MP),认为至少需1080p(约2MP)才能满足多数场景,尤其是小文本和细节。
- 评论3计算,每张图像消耗约400 tokens,每美元可处理2500张图像,性价比高。
战略方向质疑(少数观点):
- 评论5质疑,DeepSeek创始人曾表示专注文本、不发展多模态,认为文本足以实现AGI,现在推出视觉功能是否矛盾。
其他关注点:
- 评论4询问模型是否开源权重。
- 评论9指出,视觉功能使基准测试成绩略有提升。
- 评论10、11未提供实质观点,仅简短提问或调侃。
关键引用(保留中英文):
- 评论1:“I've heard that DeepSeek v4 Flash 0731 has frequently assumed that it has vision capabilities... this is a great upgrade for the model.”
- 评论2:“It's useful but for OCR and a lot of other applications it needs to be a bit higher (eg: putting in a full A4 / Letter sized page)”
- 评论5:“Wasn't Deepseek's founder saying that they had explicitly decided not to focus on multimodal models at all...?”
- 评论6:“800x800 is 640,000 pixels... less than the resolution of computer screens from 1995... I think the watershed rez will be around triple that, ~1080p”
- 评论7:“Congratulations! DeepSeek has finally gained eyes — the dark days are about to be behind us.”
- 评论8:“Switched to Opus 4.6 for some tasks at work because I needed image input - horrible. So nice to get image input with DS.”