Skip to main content

功能简介

老张API 提供强大的图像和视频理解能力,支持使用多种先进的 AI 模型对图像和视频进行深度分析和理解。图片理解可使用 OpenAI 兼容 Chat Completions;视频理解请使用 Gemini 原生 generateContent 协议,以确保视频帧、画面文字和音频轨道都能被模型读取。
🔍 智能视觉分析
支持对象识别、场景理解、文字提取、情感分析、视频内容理解等多种视觉任务,让 AI 真正”看懂”图片和视频。

🌟 核心特性

  • 🎯 多模型支持:GPT-5、Gemini 2.5 Pro/Flash 等顶级视觉模型
  • 📸 灵活输入:图片支持 URL 和 Base64;视频支持 Gemini 原生 file_data URL 和 inlineData Base64
  • 🎬 视频理解:Gemini 系列支持视频内容分析和 OCR,部分模型可同时读取音频轨道
  • 🌏 中文优化:完美支持中文场景理解和文字识别
  • ⚡ 快速响应:高性能推理,秒级返回结果
  • 💰 成本可控:多种模型选择,满足不同预算需求

📋 支持的视觉模型

💡 视频分析提示:目前仅 Gemini 系列模型支持视频内容理解。Chat Completions 的 video_url / 将 MP4 填入 image_url 不作为视频理解推荐接入方式;请使用下方 Gemini 原生协议。

🚀 快速开始

1. 基础示例 - 图片 URL

2. 本地图片示例 - Base64 编码

3. 高级示例 - 多图对比分析

🎬 视频内容分析

支持的视频模型

目前仅 Gemini 系列模型支持视频分析。以下模型已用同一个 MP4 样本通过 generateContent + file_data 实测:
gemini-3-pro-imagegemini-3.1-flash-image*-image 模型是图像生成/编辑模型,不作为视频理解默认模型。是否读取音轨请以返回的 usageMetadata.promptTokensDetails 是否包含 AUDIO 为准。

已验证的协议

视频理解请走 Gemini 原生接口:
  • POST https://api2.laozhang.ai/v1beta/models/{model}:generateContent
  • 认证方式:x-goog-api-key: YOUR_API_KEYAuthorization: Bearer YOUR_API_KEY
  • 远程视频:使用 file_data.mime_type + file_data.file_uri
  • 本地视频:使用 inlineData.mimeType + inlineData.data
不建议用 /v1/chat/completions 传视频。实测 video_url 请求会作为文本 URL 处理,模型可能明确回复无法访问视频;把 MP4 放进 image_url 会返回请求错误。

1. 远程视频 URL 分析

maxOutputTokens 可以不设置。需要限制输出时,请不要设得过小;gemini-2.5-pro 会先消耗推理 token,输出预算太低可能导致空响应或回答不完整。
提取返回文本:

2. Python 示例

3. 本地视频 Base64 上传

本地视频建议优先上传到可访问的 HTTPS 地址,再使用 file_data。如果必须直接传文件,可以使用 Base64;请求体会比原文件大约增加 33%。

4. 返回结构

成功响应包含 candidatesusageMetadatamodelVersionresponseId。视频被真实读取时,usageMetadata.promptTokensDetails 中会出现 VIDEO,如果视频有音轨,还会出现 AUDIO

5. 视频 + 图片混合分析

Gemini 原生协议支持在同一个 parts 数组里混合视频、图片和文本。图片可以使用 file_data URL 或 inlineData Base64。
MIME 类型说明 不同视频格式需要使用对应的 MIME 类型:
  • MP4video/mp4
  • WebMvideo/webm
  • MOVvideo/quicktime
  • AVIvideo/x-msvideo
💡 最佳实践:Base64 编码会增加约 33% 的数据量。对于大视频文件(>10MB),建议优先使用 file_data URL 方式。小视频文件可以使用 inlineData,但仍建议设置较长的请求超时。

视频分析最佳实践

  1. 文件大小:建议单个视频 ≤20 MB,超大视频可能导致处理时间过长
  2. 视频格式:支持 MP4、WebM、MOV、AVI 等主流格式
  3. 视频时长:短视频(< 5 分钟)效果最佳,超长视频建议分段处理
  4. 分辨率:高分辨率视频识别效果更好,但会增加处理时间
  5. 提示词优化:明确指出需要分析的内容(如”分析人物动作”、“提取对话内容”等)
  6. 输出长度maxOutputTokens 可以不设置;如果设置,避免过小,否则 Gemini 2.5 Pro 的推理 token 可能先耗尽输出预算

视频分析应用场景

  • 📹 内容审核:自动识别视频中的不当内容
  • 🎓 教学视频分析:提取关键知识点和字幕
  • 🛡️ 监控视频理解:异常行为检测和事件识别
  • 🎬 广告素材分析:评估创意元素和情感传递效果
  • 📊 体育赛事分析:识别运动员动作和比赛关键时刻
⚠️ 注意事项
  • 视频处理时间通常比图片长(取决于视频长度和复杂度)
  • 如需控制输出长度,请使用 generationConfig.maxOutputTokens
  • 对于隐私敏感的视频内容,请注意数据安全

🎯 常见应用场景

1. 商品识别与分析

2. 文档 OCR 识别

3. 医学影像辅助分析

4. 安全监控场景分析

💡 最佳实践

图片预处理建议

  1. 格式支持:JPEG、PNG、GIF、WebP 等主流格式
  2. 大小限制:建议单张图片不超过 20MB
  3. 分辨率:高分辨率图片会获得更好的识别效果
  4. 压缩优化:适度压缩以提高传输速度

提示词优化

错误处理

🔧 高级功能

1. 流式输出

对于长篇分析,可以使用流式输出获得更好的用户体验:

2. 多轮对话

保持上下文进行深入分析:

3. 结合函数调用

📊 性能对比

🚨 注意事项

  1. 隐私保护:不要上传包含敏感信息的图片和视频
  2. 合规使用:遵守相关法律法规,不用于非法用途
  3. 结果验证:AI 分析结果仅供参考,重要决策需人工复核
  4. 成本控制:合理选择模型,避免不必要的开销
  5. 视频限制:视频分析仅支持 Gemini 系列,其他模型暂不支持

🔗 相关资源

💡 小贴士:建议先使用 Gemini 2.5 Flash 或 GPT-4.1 Mini 进行测试,确认效果后再使用高级模型进行生产部署。