2026 年 9 月 LLM API 价格崩盘:GPT-6 Astra / Fable 5.1 / Gemini 3.8 Flash 等 5 大厂商完整对比表
2026 年 9 月第一周,OpenAI GPT-6 Astra、Anthropic Claude Fable 5.1、Google Gemini 3.8 Flash 同期发布,加上 Sonnet 5 定价永久化、DeepSeek V4 Pro 大幅降价,五大厂商同周改写 LLM API 价格曲线。本文给出完整的每百万 token 输入/输出价格对比表、缓存价格、上下文窗口与实测 benchmark,并给出基于 NixAPI 的统一路由接入建议。
2026 年 9 月的第一周,AI 行业上演了一场前所未有的「同周撞档」:Anthropic Claude Fable 5.1(9/1)、Google Gemini 3.8 Flash(9/2)、OpenAI GPT-6 Astra(9/3)先后发布,DeepSeek 也在同一窗口完成 V4 Pro 0813 的降价放量。叠加 Anthropic 把 Sonnet 5 的引流价 $2/$10 永久化,五大厂商在五天内把整个 LLM API 价格曲线重写了一遍。
这不是一次普通的版本迭代,而是「价格 - 能力双重竞争」进入新阶段的信号:三家头部厂商步调一致地推 1M 上下文、对齐 agentic coding,并把缓存价格当成新的竞争焦点。
本文给你一张完整的、可执行的对比表:每百万 token 的输入/输出价格、缓存读取、上下文窗口、核心 bench mark,以及这次价格波动里真正的隐藏成本——思考 token(thinking tokens)也按输出计费。
一、核心价格对比表(2026 年 9 月 8 日更新)
价格为每百万 token、标准档(Standard)美元价。Batch/Flex 通常为 50% off,Fast/Priority 通常为 2x。
| 模型 | 供应商 | 输入 $/M | 输出 $/M | 缓存读取 $/M | 上下文 | 上线日期 |
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | $10.00 | $50.00 | $1.00 | 1.05M | 9/3 发布 · 9/4 API |
| GPT-5.6 Sol | OpenAI | $4.00 | $20.00 | $0.40 | — | 参考 |
| Claude Fable 5.1 | Anthropic | $10.00 | $50.00 | $0.25 | 1M | 9/1 |
| Gemini 3.8 Flash | $0.75* | $3.75* | $0.075 | 1.048M | 9/2 | |
| DeepSeek V4 Pro 0813 | DeepSeek | $0.435 | $0.87 | $0.0036 | 1M | 8/12 GA |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | — | 1M | 定价永久化 |
* Gemini 3.8 Flash 的 $0.75/$3.75 为年终促销价,到 2026-12-31 截止;2027-01-01 起恢复标准价 $1.50/$7.50(输入/输出)。
一眼看懂这张表
- 最便宜:DeepSeek V4 Pro 无悬念——输入 $0.435、输出 $0.87,比 GPT-6 Astra 便宜一个数量级;
- 最贵:GPT-6 Astra 与 Claude Fable 5.1 并列第一梯队,均 $10/$50;
- 价格 - 能力前沿最佳:Gemini 3.8 Flash 的 $0.75/$3.75,是 Astra/Fable 的 1/13,但 Terminal-Bench 2.1 已到 90.8%(官方)——接近昂贵旗舰的水平;
- 隐藏赢家:Anthropic 把 Fable 5.1 的缓存读取从 $1 砍到 $0.25(降 75%),对长上下文 agentic 工作负载的成本影响巨大。
二、五家到底在拼什么?
1. OpenAI GPT-6 Astra:旗舰价格再上一个台阶
GPT-6 Astra 于 9 月 3 日发布、9 月 4 日上线 API,模型代号 gpt-6-astra,上下文 1,050,000 token、最大输出 128K。
定价:标准 $10/$50;缓存读取 $1(缓存写入 $12.50);超过 272K 输入 token 的长上下文按 2x 输入/1.5x 输出计费。
它比 GPT-5.6 Sol($4/$20)贵 2.5 倍。它和 Claude Fable 5.1 同为当前第一贵的旗舰,也是 OpenAI 首个把缓存写入单独列为 $12.50 计费项(1.25x 未缓存输入)的模型——对长 prompt 的 agentic 任务,缓存成本被单列出来。
2. Claude Fable 5.1:真正的「价格屠夫」在缓存
Fable 5.1 的表面价与 Fable 5 相同($10/$50),真正的杀招是缓存读取从 $1 砍到 $0.25(降 75%,为 Fable 5 的 1/4)。
Anthropic 官方估计:典型工作负载总成本降约 25%,复杂编码 / agentic 场景最多可省约 45%——因为 agentic 任务会反复读取同一段持久上下文。
对跑长会话 agent / 批量编码的团队,Fable 5.1 的实际成本竞争力远超表面价格。
3. Gemini 3.8 Flash:把「成本-性能前沿」拉低 13 倍
Google 在 3.6/3.7 之后,六周内第三次发 Flash 序列(3.8 Flash),这一次直接用 $0.75/$3.75 年终促销价入场。
- Terminal-Bench 2.1:90.8%(官方)/ 89.4%(AA 独立实测)——逼近甚至超过部分昂贵旗舰;
- DeepSWE 1.1(长程软件工程):73.7%(AA)——「处理复杂工程任务时超过大多数更大旗舰模型」;
- HLE-Verified:54.9%——多步推理与专业领域能力。
关键点:思考 token 按输出计费,且 API 里 thoughtsTokenCount 与 candidatesTokenCount 分开返回,两桶都按 $3.75 计。预算跨过 2026-12-31 的,得按 1 月起的 $1.50/$7.50 算。
4. DeepSeek V4 Pro 0813:绝对低价 + 峰谷计费转型
DeepSeek V4 Pro 0813(8/12 GA)把 cache-miss 输入定在 $0.435、输出 $0.87,缓存命中仅 $0.0036——是目前主流大型模型中无可争议的最低价。
注意它已从 8/16(UTC) 起转入峰谷计费:低谷价比峰值价低一半,但新的低谷价仍比 0813 现价高 50% 以上。规划长期预算要看清楚自己的调用时段落在峰还是谷。
5. Claude Sonnet 5:引流价「永久化」
Sonnet 5 的 $2/$10 原本是限时促销,如今 Anthropic 宣布永久化——把一个中端 1M 上下文模型的定价腰斩成历史常态。这是竞争姿态:Sonnet 5 用比 Opus/Fable 便宜 5 倍的价格,主打「快 + 便宜 + 够用」的日常生产负载。
三、真正的成本暗礁:thinking tokens & 缓存
这次价格崩盘里,有两个容易被表象误导的细节:
3.1 思考 token 按「输出」计费
Gemini 3.8 Flash、GPT-6 Astra、Claude Fable 5.1 都在推理前「想再想」。这些思考 token 全部按输出价计费,不是按便宜的输入价。
- Gemini 3.8 Flash:思考 + 可见答案都在
$3.75(输出桶); - GPT-6 Astra / Fable 5.1:思考 token 按 $50/百万 输出价算。
实操含义:一个「看起来便宜」的输入价(如 Flash 的 $0.75)只反映 prompt 灌入成本;真正的 bill 由输出侧决定。选型时要用「每任务成本」而非「每 token 价格」比较——例如 Artificial Analysis 实测 Gemini 3.8 Flash 由于多生成约 30% 输出 token,单任务成本 $0.58,高于 3.7 Flash 的 $0.40。
3.2 缓存价才是 agentic 的胜负手
长上下文 agent 会不断重读同一前缀。五家缓存读取价对比:
| 模型 | 缓存读取 $/M | vs 输入价 |
|---|---|---|
| Claude Fable 5.1 | $0.25 | 2.5% 输入价 |
| GPT-5.6 Sol | $0.40 | 10% |
| GPT-6 Astra | $1.00 | 10% |
| Gemini 3.8 Flash | $0.075 | 10% |
| DeepSeek V4 Pro | $0.0036 | <1% |
DeepSeek 的缓存命中价低到 $0.0036(几乎免费),Fable 5.1 用 $0.25 抢 agentic 负载。G同是 1M 上下文,你的工作负载越是「重读型」(RAG、长会话、代码库级 agent),缓存价权重就越高。
四、所以,作为开发者你该怎么选?
给三类典型场景直接结论:
| 你的场景 | 推荐 | 理由 |
|---|---|---|
| 成本极度敏感、大批量、检索型 | DeepSeek V4 Pro | 输入 $0.435/缓存几乎免费,长上下文 RAG 首选 |
| agentic / 长会话,要旗舰级能力 | Claude Fable 5.1 | 缓存 $0.25 让长会话成本大降 |
| 高性能 + 高性价比均衡 | Gemini 3.8 Flash | TB2.1 90.8%,$0.75/$3.75 年终价,1M ctx |
| 日常生产、要快要稳的 Workhorse | Sonnet 5($2/$10 永久) | 中端价腰斩,适合默认负载 |
| 要最强推理 / coding SOTA、预算宽裕 | GPT-6 Astra | 1.05M ctx + 旗舰,但 $10/$50 最贵 |
五、用 NixAPI 做「价格路由层」,而不是锁死单一厂商
价格崩盘的另一面是选型风险:今天 Gemini 3.8 Flash 便宜,明天 DeepSeek 峰谷价变化、后天 Fable 5.1 缓存价调整——绑死一家,等于把成本曲线交给别人。
NixAPI 的价值不是”帮你选模型”,而是让你用一套 OpenAI 兼容接口同时接入全部厂商,把 model 字段当作路由开关:
curl https://nixapi.com/v1/chat/completions \
-H "Authorization: Bearer $NIXAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-6-astra",
"messages": [{"role": "user", "content": "重构这个 Python 模块并解释你的思路。"}]
}'
想对比跑哪个,改 model 字段即可,业务代码零改动:
- 贵在
anthropic/claude-fable-5-1/openai/gpt-6-astra - 便宜在
google/gemini-3.8-flash/deepseek/deepseek-v4-pro
加上统一的缓存命中计费、批量折扣对齐,NixAPI 让你在五家之间做运行时路由,把「价格崩盘」真正变成你的成本优势,而不是选择焦虑。
结语
2026 年 9 月的第一周,五大厂商用五天重写了 LLM API 价格地图:
- 旗舰新贵:GPT-6 Astra 与 Claude Fable 5.1 并肩登顶 $10/$50;
- 性价比之王:Gemini 3.8 Flash 用 $0.75/$3.75 把前沿能力拉到 1/13 价格;
- 绝对低价:DeepSeek V4 Pro $0.435/$0.87,缓存几乎免费;
- 中端腰斩:Sonnet 5 永久化 $2/$10;
- 隐藏变量:思考 token 按输出计费、缓存价成为 agentic 胜负手。
真正聪明的接法不是盯着一张价格表选”最好”,而是用 NixAPI 这类聚合层把它们都作为运行时选项。1M 上下文 + agentic coding + 缓存竞争的时代,谁能在厂商间自由路由,谁就掌握了价格曲线的主动权。
相关阅读 / 来源引用
- OpenAI GPT-6 Astra API Pricing — developers.openai.com/api/docs/pricing
- Anthropic Fable 5.1 Pricing — platform.claude.com/docs/en/about-claude/pricing
- Google Gemini 3.8 Flash Pricing & Benchmarks — ai.google.dev/gemini-api/docs/pricing
- DeepSeek V4 Pro 0813 Pricing — api-docs.deepseek.com/quick_start/pricing
- Artificial Analysis Terminal-Bench v2.1 Leaderboard — artificialanalysis.ai/evaluations/terminalbench-v2-1
- NixAPI 支持模型与价格 · NixAPI API 文档 · NixAPI 控制台