功能简介
老张API 提供强大的音频处理能力,包括音频转文字(Speech-to-Text)和文字转语音(Text-to-Speech)两大功能。通过统一的 OpenAI API 格式,您可以轻松实现会议记录转录、字幕生成、语音助手、有声读物制作等应用。🎙️ 智能音频处理
支持多语言音频转文字、高清语音合成、实时流式输出,让 AI 真正”听懂”和”说出”内容。
支持多语言音频转文字、高清语音合成、实时流式输出,让 AI 真正”听懂”和”说出”内容。
🌟 核心特性
- 🎯 多模型支持:GPT-4o Transcribe、GPT-4o Mini Transcribe、TTS-1/HD、GPT-4o Mini TTS 等专业音频模型
- 🌍 多语言识别:支持 50+ 种语言的音频转文字
- 🎤 高质量合成:支持标准和高清两种语音质量
- 🗣️ 多种音色:6 种不同的语音音色可选
- ⚡ 快速响应:高性能处理,秒级返回结果
- 💰 灵活计费:转录按 token 计费,语音合成按模型与文本量计费,成本可控
📋 支持的音频模型
音频转文字(Speech-to-Text)
文字转语音(Text-to-Speech)
gpt-4o-audio-preview 和 gpt-4o-mini-audio-preview 在模型列表中可见,但它们不是本页 /audio/transcriptions 或 /audio/speech 的默认接入模型。实测放入这两个 audio endpoints 会返回负载/模型类错误,请不要按 STT/TTS 接口配置。可用的语音音色
- alloy - 中性音色,清晰自然
- echo - 男性音色,沉稳有力
- fable - 英式口音,优雅动听
- onyx - 深沉男声,适合播报
- nova - 女性音色,温暖亲切
- shimmer - 柔和女声,适合旁白
🎙️ 音频转文字
1. 基础示例 - cURL
使用-F 上传文件时,curl 会自动生成正确的 multipart boundary;可以不手写 Content-Type: multipart/form-data。
2. Python 示例 - 使用 OpenAI SDK
3. 纯文本响应
如果只需要文本,可以设置response_format=text。接口会返回 text/plain:
4. Mini 转录模型
gpt-4o-mini-transcribe 已验证可用,返回结构与 gpt-4o-transcribe 一致,适合成本敏感或批量转录任务。
响应格式限制
gpt-4o-transcribe和gpt-4o-mini-transcribe:已验证支持json和textsrt/vtt:当前不适用于 GPT-4o 转录模型;实测srt会返回unsupported_valuewhisper-1:模型列表可见,但当前转录调用实测返回model_not_found,不要作为生产接入默认模型gpt-4o-audio-preview/gpt-4o-mini-audio-preview:不适用于/audio/transcriptions
支持的音频格式
支持以下音频格式(文件大小建议 ≤25 MB):- mp3 - MP3 音频文件
- mp4 - MP4 音频文件
- mpeg - MPEG 音频文件
- mpga - MPEG 音频文件
- m4a - M4A 音频文件
- wav - WAV 音频文件
- webm - WebM 音频文件
🗣️ 文字转语音
1. 基础示例 - cURL
2. Python 示例 - 生成语音文件
3. 使用高清模型
4. 使用 GPT-4o Mini TTS
5. 调整语速
6. 实时流式输出
🎯 常见应用场景
1. 会议记录转录
2. 视频音频转写
GPT-4o 转录模型当前已验证支持
json 和 text。如果需要 SRT/VTT 字幕时间轴,请在业务侧做切分和时间戳对齐;不要把 whisper-1 + response_format=srt 作为默认示例。3. 多语言内容播报
4. 有声读物制作
💡 最佳实践
音频转文字优化
-
音频质量:
- 采样率建议 ≥16 kHz
- 降低背景噪音可提高识别准确度
- 清晰的人声录音效果最佳
-
文件大小:
- 单个文件 ≤25 MB
- 超大文件建议先分段处理
-
语言指定:
- 明确指定语言可提高准确度
- 支持的语言代码:zh(中文)、en(英文)、ja(日语)等
-
响应格式选择:
json:默认格式,包含转写文本和 token 用量text:纯文本输出srt/vtt:当前不适用于 GPT-4o 转录模型whisper-1:当前转录调用不可用,不建议用于生产接入
文字转语音优化
-
音色选择:
alloy/nova:适合通用场景echo/onyx:适合新闻播报fable/shimmer:适合故事朗读
-
语速调整:
- 正常语速:1.0
- 快速播报:1.2 - 1.5
- 慢速教学:0.75 - 0.9
-
文本优化:
- 单次请求文本 ≤4096 字符
- 使用标点符号控制停顿和语调
- 数字和特殊符号建议转换为文字
-
成本控制:
- 标准场景使用
tts-1 - 低延迟或轻量场景可评估
gpt-4o-mini-tts - 高质量需求使用
tts-1-hd - 根据实际需求选择合适的模型
- 标准场景使用
错误处理
📊 性能对比
音频转文字模型对比
文字转语音模型对比
🚨 注意事项
- 隐私保护:不要上传包含敏感信息的音频文件
- 合规使用:遵守相关法律法规,不用于非法用途
- 版权声明:生成的语音内容需注明由 AI 生成
- 文件限制:音频文件最大 25 MB,文本最长 4096 字符
- 使用限制:请勿用于冒充他人身份或虚假信息传播
🔗 相关资源
- Chat Completions API - 了解更多关于对话 API 的信息
- API 定价说明 - 查看详细价格信息
💡 小贴士:建议先使用
gpt-4o-mini-transcribe 或 tts-1 进行测试,确认效果后再使用高级模型进行生产部署。