DeepSeek API 加入圖片理解,支援截圖與圖表分析

DeepSeek-v4-flash-vision-exp 可把圖片與文字放在同一個請求,處理截圖、圖片描述及圖表分析。

Og image

處理產品截圖、掃描文件或圖表時,DeepSeek API 現在可讓文字問題與圖片一併送出,由 deepseek-v4-flash-vision-exp 回應內容。這個視覺模型適合用於圖片描述、讀取截圖文字,以及分析圖表等需要結合視覺與語言的工作流。

API 採用 OpenAI-compatible Chat Completions 格式,請求中的 content 不再只是單一字串,而是由文字和圖片區塊組成;Responses API 亦支援以 input_image content parts 傳送圖片。開發者可按項目需要選擇圖片提交方式,文件列出三種方法,其中包括直接內嵌 Base64 圖片,以及提供公開可存取的 http(s) 圖片網址。

支援的圖片格式包括 JPEG、PNG、GIF 和 WebP。系統會按檔案實際內容判斷格式,而不是依賴檔名或宣告的 MIME type;使用 Base64 內嵌本地圖片較直接,但編碼後的資料會計入 48 MiB request body 上限。

  • 可同時分析文字與圖片
  • 適合讀取截圖文字及分析圖表
  • 支援 JPEG、PNG、GIF 和 WebP
  • 兼容 Chat Completions 與 Responses API
  • Base64 圖片會受 48 MiB 請求大小限制

需要把圖片理解接入現有 OpenAI SDK 或 API 工作流的開發者,可沿用熟悉的請求結構,再按圖片來源選擇內嵌資料或公開網址。圖片網址必須可供模型下載,並受 8192 字元長度限制。

項目主頁

Categories: DeepSeek, Agentic, API, Image