
RPM和TPM是 AI 大模型 API 中常见的速率限制单位。RPM(Requests Per Minute)含义每分钟请求数(Requests Per Minute)解释一分钟内最多可以发送多少次 API 请求。例子如果限额是 60 RPM就意味着平均每秒只能发 1 次请求超过就会被限流(返回 429 错误)。TPM(Tokens Per Minute)含义每分钟 Token 数(Tokens Per Minute)解释一分钟内最多可以处理多少个 Token(包括输入 输出)。例子如果限额是 100,000 TPM那么输入和输出加起来不能超过这个数量否则也会被限流。简单对比缩写全称限制对象常见影响RPMRequests Per Minute请求次数并发调用、频繁小请求TPMTokens Per MinuteToken 用量长文本、大模型输出、高并发两者通常会同时存在任何一个超限都会触发限流。实际使用时建议同时关注这两个指标并做好重试和排队策略。