Skip to main content

直接答案

视觉理解能力取决于模型、端点和输入协议。先在模型目录确认目标模型支持的端点,再按 OpenAI 兼容、Responses、Gemini 原生或厂商原生结构提交图片、视频、PDF或文件。不要因为模型支持图片就推断它支持视频、PDF、OCR、工具或所有 MIME。 本页最后核对日期为 2026 年 9 月 2 日

选择协议

最小图片理解请求

以下仅展示常见 OpenAI Chat Completions 结构:
Base64、file ID、视频和 PDF 使用不同结构时,应按模型专题页处理。

生产验收

  • 支持的 MIME、大小、分辨率、页数、时长和文件来源;
  • 多图片顺序、旋转、透明通道和 EXIF;
  • OCR、表格、图表和小字的准确性;
  • 视频抽帧、音轨、时间定位和处理状态;
  • 无法访问 URL、损坏文件和不支持格式的错误;
  • 数据跨境、上游保留和敏感信息处理;
  • usage、计费和调用日志。
视觉模型输出可能遗漏或误读内容。法律、医疗、财务、身份和其他高风险场景必须保留人工复核,不能将模型结果作为唯一结论。

相关文档