> ## Documentation Index
> Fetch the complete documentation index at: https://docs.laozhang.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 老张API可以开多少并发？

> 老张API目前不限制账户和令牌的并发数。本页说明为什么高并发时仍可能收到 429、怎样用队列和退避重试控制请求，以及大批量任务前该做什么。

老张API目前不限制账户或令牌的并发数，文本、图片和视频模型都一样。如果之后调整，会在[网站公告](/changelog)中通知。高并发时仍可能收到 `429`，它来自上游模型的速率或容量限制，需要在自己的代码里控制节奏。

| 项目 | 内容 |
| - | - |
| 平台并发限制 | 目前不限制 |
| `429` 的来源 | 上游模型的速率或容量限制 |
| 是否扣费 | 返回 `429`、没有进入生成的请求通常不扣费 |
| 处理方式 | 本地队列控制并发，`429` 时退避重试 |

## 收到 429 时怎么处理

<Steps>
  <Step title="看错误正文">
    `429` 的正文会说明是限流、容量不足还是额度问题。错误正文含 `insufficient_user_quota` 时是余额不够预扣，按[有余额却调用失败](/faq/balance-insufficient)处理，重试没有用。
  </Step>

  <Step title="退避后重试">
    每次重试前等待更长时间，例如 1、2、4、8 秒，并加一点随机抖动，设置最多重试次数。不要在收到 `429` 后立即原样重发。
  </Step>

  <Step title="降低同时发出的请求数">
    用本地队列或信号量限制同时进行的请求。持续出现 `429` 时，先把并发降到一半，再逐步调高。
  </Step>
</Steps>

## 用信号量控制并发

下面的 Python 示例最多同时发出 10 个请求，遇到 `429` 时按指数退避重试：

```python theme={null}
import asyncio
import os
import random
from openai import AsyncOpenAI, RateLimitError

client = AsyncOpenAI(
    api_key=os.environ["LAOZHANG_API_KEY"],
    base_url="https://api.laozhang.ai/v1",
    max_retries=0,
)
limit = asyncio.Semaphore(10)  # 同时进行的请求数


async def ask(prompt, attempts=5):
    async with limit:
        for attempt in range(attempts):
            try:
                response = await client.chat.completions.create(
                    model="gpt-5.4-mini",
                    messages=[{"role": "user", "content": prompt}],
                )
                return response.choices[0].message.content
            except RateLimitError:
                if attempt == attempts - 1:
                    raise
                await asyncio.sleep(2 ** attempt + random.random())


async def main():
    prompts = [f"用一句话介绍数字 {i}" for i in range(50)]
    results = await asyncio.gather(*(ask(p) for p in prompts))
    print(results[:3])


asyncio.run(main())
```

运行前执行 `pip install openai` 并设置环境变量 `LAOZHANG_API_KEY`。图片和推理请求耗时长，并发数宜设得更低，并按[请求超时](/faq/request-timeout)设置 timeout。

## 大批量任务前

* 先用小批量跑通，在[调用日志](https://api.laozhang.ai/log)里核对耗时、成功率和扣费。
* 视频模型是异步任务，提交后轮询状态，轮询间隔按各视频模型页的建议设置，不要高频查询。
* 计划短时间内发出大量请求时，提前把模型、预计请求量和时间段发给支持团队 [hi@laozhang.ai](mailto:hi@laozhang.ai)，便于确认上游容量。

## 常见问题

### 多个令牌能提高并发吗？

不需要。平台目前不按令牌限制并发，拆分令牌不会提高上限。按服务或环境拆分令牌是为了管理和安全，见 [API Key 管理](/faq/token-management)。

### 不限制并发，为什么还会变慢？

上游模型在高峰时段排队，单次请求的耗时会变长，并发越高，同时等待的请求越多。慢请求先检查 timeout 是否足够，再看是否需要降低并发。

## 相关文档

* [API 请求超时怎么办](/faq/request-timeout)
* [为什么还有余额但调用失败](/faq/balance-insufficient)
* [如何确认模型是否可用](/faq/model-availability)
* [老张API开发文档：处理调用错误](/api-manual)


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.