框架: max_tokens默认改512000(创始人拍板不设限;预扣$0.154/次已验证网关接受,余额须≥并发×0.154)

This commit is contained in:
zizi 2026-07-15 14:31:40 +08:00
parent d8b7c66661
commit 66bad3157b

View File

@ -28,16 +28,17 @@ class SensitiveError(Exception):
立即抛给上层走模型降级链创始人 2026-07-14M3MiniMax-M2.7deepseek-v4-flash"""
def chat(prompt, model=DEFAULT_MODEL, max_tokens=12000, temperature=0.2,
def chat(prompt, model=DEFAULT_MODEL, max_tokens=512000, temperature=0.2,
retries=2, timeout=900, system=None, top_p=None):
"""单轮对话,返回 (content, usage)。网络错/5xx/429 指数退避重试。
content 已剥离 <think></think>推理模型可能把思考混进正文
system身份段与任务材料分离角色遵从更稳身份段利于上游缓存
top_p temperature 分化实验用M 家族官方推荐 1.0/0.95eval A/B 后定版
max_tokens 默认 120002026-07-15 降自 32000New-API max_tokens **预扣费**
余额低于预扣线时大请求 403实测预扣 $0.00975/32k全管线实测输出最大 6060
中位 33112000 留一倍余量且预扣降 2/3同样余额多跑 2.5 倍请求
max_tokens 默认 512000创始人 2026-07-15 拍板不设人为输出限制
预扣费机制备忘New-API max_tokens 预扣512k 预扣 $0.15375/网关已验证接受该值
结算按实际用量余额充足时预扣不产生额外成本**余额须 并发路数 × $0.154**
否则触发 403预扣费额度失败2026-07-15 余额见底实测坐实此机制
"""
s = requests.Session()
s.trust_env = False # 本机代理 env 会劫持内网直连