DeepSeek-v4-闪光视觉实验
deepseek-v4-闪光-视觉-实验模型同时接受图像和文本,因此您可以要求模型描述图片、从截图中读取文本、分析图表等。支持的图像格式包括:JPEG、PNG、GIF 和 WebP。格式是根据实际文件内容检测的,而不是根据文件名或声明的 MIME 类型。发送图像有三种方法可以向模型提供图像。所有方法都使用标准的 OpenAI 兼容的聊天完成格式,其中内容是一个块数组,而不是简单的字符串。同样的三种方法也可以在响应 API 中使用,图像在 input_image 内容部分中传递。以下示例的 base_url 是 https://api.deepseek.com 。 1. Base64 编码图像(内联) 将图像编码并直接嵌入请求中作为 data: URL。这是本地文件的最简单选项。编码数据计入 48 MiB 请求主体限制(请参见限制)。 import base64 from openai import OpenAI client = OpenAI ( api_key = "<DeepSeek API Key>", base_url = "https://api.deepseek.com") with open ( "image.jpg", "rb") as f: b64 = base64.b64encode(f.read()).decode("utf-8") response = client.chat.completions.create( model = "deepseek-v4-闪光-视觉-实验", messages = [{ "role": "user", "content": [{ "type": "text", "text": "这张图片中有什么?"}, { "type": "image_url", "image_url": { "url": f"data:image/jpeg;base64,{b64} "}}]} }]) print (response.choices[0].message.content) curl https://api.deepseek.com/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer <DeepSeek API Key>" \ -d '{ "model": "deepseek-v4-闪光-视觉-实验", "messages": [{ "role": "user", "content": [{"type": "text", "text": "这张图片中有什么?"}, {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,<BASE64_DATA>"}}]} }]} ' 2. 外部图像 URL 传递一个公开可访问的 http(s) 链接,模型将为您下载图像。 URL 最多可以有 8192 个字符,图像文件最多 32 MiB,下载必须在 60 秒内完成。如果您的链接较长,请改用 base64 数据 URL 或 Files API。 response = client.chat.completions.create( model = "deepseek-v4-闪光-视觉-实验", messages = [{ "role": "user", "content": [{ "type": "text", "text": "描述这张图片。" }, { "type": "image_url", "image_url": { "url": "https://example.com/image.jpg"}}]} }]) print (response.choices[0].message.content) 3. 通过 Files API 上传的文件引用。 使用 Files API 上传一次图像,然后在请求中引用其 file_id。当您在多个请求中重用相同的图像,或者当图像使请求主体超过 48 MiB 内联限制时,这是最佳选择。与内联图像不同,通过 Files API file_id 引用的图像最大可以达到 64 MiB,并且不受每图像 32 MiB 检查的限制。使用返回的 file_id(其形式为 file-api-...)的文件内容块: response = client.chat.completions.create( model = "deepseek-v4-闪光-视觉-实验", messages = [{ "role": "user", "content": [{ "type": "text", "text": "这张图片中有什么?"}, { "type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"}]} }]) print (response.choices[0].message.content) 或者,文件块可以通过 file_data 将图像作为 base64 内联传递,而不是 file_id(两者互斥): { "type": "file", "file_data": "data:image/jpeg;base64,<BASE64_DATA>", "filename": "image.jpg"} 详细程度 对于 image_url 输入,您可以选择设置 detail 字段以控制图像的处理: 值 行为 low 图像在推理前被缩放至 512×512。速度更快且费用更低,适合视觉细节不重要的情况。 high 保持原始图像。(提供兼容性;等价于原始) original 保持原始图像。 auto 自动选择。目前等价于 original。 { "type": "image_url", "image_url": {"url": "https://example.com/image.jpg", "detail": "low"}} 使用 Files API 的时机 内联图像(base64 或 file_data)计入 48 MiB 的请求主体大小限制。当: 单个请求会超过主体大小限制。 图像大于 32 MiB,这只能通过 Files API 实现。 您希望在多个请求中引用同一图像,并避免每次重复上传。 令牌使用 图像根据其尺寸转换为令牌,这些令牌与您的文本令牌一起计费。在推理之前,每个图像会自动调整大小: 总像素数低于大约 384×384 的图像在保持其宽高比的同时被放大。较大的图像在保持其宽高比的同时被缩小,以便调整大小后的总像素数大致等于 800×800 图像的像素数。因此,会出现一个增加
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡