框架: max_tokens默认改512000(创始人拍板不设限;预扣$0.154/次已验证网关接受,余额须≥并发×0.154)
This commit is contained in:
parent
d8b7c66661
commit
66bad3157b
@ -28,16 +28,17 @@ class SensitiveError(Exception):
|
||||
立即抛给上层走模型降级链(创始人 2026-07-14:M3→MiniMax-M2.7→deepseek-v4-flash)。"""
|
||||
|
||||
|
||||
def chat(prompt, model=DEFAULT_MODEL, max_tokens=12000, temperature=0.2,
|
||||
def chat(prompt, model=DEFAULT_MODEL, max_tokens=512000, temperature=0.2,
|
||||
retries=2, timeout=900, system=None, top_p=None):
|
||||
"""单轮对话,返回 (content, usage)。网络错/5xx/429 指数退避重试。
|
||||
|
||||
content 已剥离 <think>…</think>(推理模型可能把思考混进正文)。
|
||||
system:身份段与任务材料分离(角色遵从更稳、身份段利于上游缓存)。
|
||||
top_p:随 temperature 分化实验用(M 家族官方推荐 1.0/0.95,eval A/B 后定版)。
|
||||
max_tokens 默认 12000(2026-07-15 降自 32000):New-API 按 max_tokens **预扣费**,
|
||||
余额低于预扣线时大请求 403(实测预扣 $0.00975/32k);全管线实测输出最大 6060、
|
||||
中位 331,12000 留一倍余量且预扣降 2/3——同样余额多跑 2.5 倍请求。
|
||||
max_tokens 默认 512000(创始人 2026-07-15 拍板:不设人为输出限制)。
|
||||
预扣费机制备忘:New-API 按 max_tokens 预扣(512k 预扣 $0.15375/次,网关已验证接受该值;
|
||||
结算按实际用量,余额充足时预扣不产生额外成本)——**余额须 ≥ 并发路数 × $0.154**,
|
||||
否则触发 403「预扣费额度失败」(2026-07-15 余额见底实测坐实此机制)。
|
||||
"""
|
||||
s = requests.Session()
|
||||
s.trust_env = False # 本机代理 env 会劫持内网直连
|
||||
|
||||
Loading…
x
Reference in New Issue
Block a user