直接答案
视觉理解能力取决于模型、端点和输入协议。先在模型目录确认目标模型支持的端点,再按 OpenAI 兼容、Responses、Gemini 原生或厂商原生结构提交图片、视频、PDF或文件。不要因为模型支持图片就推断它支持视频、PDF、OCR、工具或所有 MIME。 本页最后核对日期为 2026 年 9 月 2 日。选择协议
最小图片理解请求
以下仅展示常见 OpenAI Chat Completions 结构:生产验收
- 支持的 MIME、大小、分辨率、页数、时长和文件来源;
- 多图片顺序、旋转、透明通道和 EXIF;
- OCR、表格、图表和小字的准确性;
- 视频抽帧、音轨、时间定位和处理状态;
- 无法访问 URL、损坏文件和不支持格式的错误;
- 数据跨境、上游保留和敏感信息处理;
- usage、计费和调用日志。