AI Model Field Guide
Independent field notes / 2026

选模型,不押品牌。

六种主流商业 AI 模型,同一张桌子上比较。这里不做虚假的“总冠军”排名,只回答三个更实用的问题:能做什么、要花多少、什么时候不该选它。

资料更新时间2026 年 8 月 1 日
价格均来自厂商官方页面
01 / Quick chooser

先从工作负载出发

推荐是基于厂商公开定位、接口能力与价格结构的实用归纳,不是跨模型基准测试结论。

LONG-HORIZON

复杂推理、代码与长流程 Agent

优先测试旗舰闭源模型;用你自己的真实任务做评测,尤其关注工具调用稳定性和失败恢复。

GPT-5.6 Sol · Claude Opus 5
MULTIMODAL

多模态理解与原型

Gemini 的原生多模态和 Google 工具生态值得优先验证,但 Pro 当前仍带 Preview 标记。

Gemini 3.1 Pro Preview
ECONOMICS

成本敏感的规模化 API

DeepSeek 的公开单价显著低;上线前仍要单独压测吞吐、延迟、合规和目标语言质量。

DeepSeek V4-Pro
REGIONAL FIT

中国大陆接入与中文业务

千问提供人民币计价和国内云服务路径;不要把人民币价格直接与美元价格条目相减。

Qwen3.7-Max
02 / At a glance

核心规格,一眼看清

价格为标准实时 API 的每百万 tokens 输入 / 输出价;缓存、Batch、工具调用、长上下文和区域费率可能另计。

模型官方定位摘要上下文输入 / 输出输入模态状态
GPT-5.6 SolOpenAI复杂专业工作、推理与编码旗舰1.05M$5 / $30USD / MTok文本、图像旗舰
Claude Opus 5Anthropic复杂 Agent 编码与企业工作1M$5 / $25USD / MTok文本、图像正式可用
Gemini 3.1 ProGoogle多模态理解、Agent 与复杂编码以官方模型页为准$2 / $12≤200K prompt多模态Preview
Grok 4.5xAIAgent 软件、工程和工作流任务500K$2 / $6USD / MTok文本、图像API 可用
DeepSeek V4-ProDeepSeek思考 / 非思考双模式与高性价比1M$0.435 / $0.87cache miss / output文本API 可用
Qwen3.7-MaxAlibaba Cloud思考 / 非思考双模式,国内云路径1M¥12 / ¥36CNY / MTok 原价文本正式可用
03 / Model files

六份模型档案

“适合”描述的是优先评估方向。任何采购决策都应补充内部质量、安全、延迟和总成本评测。

01 · OPENAI

GPT-5.6 Sol

旗舰推理与编码模型,工具覆盖面完整,适合复杂专业任务。

  • 上下文1.05M
  • 最大输出128K
  • 工具Web / File / Computer
查看官方模型页 ↗
02 · ANTHROPIC

Claude Opus 5

面向复杂 Agent 编码与企业工作,支持自适应思考和多云接入。

  • 上下文1M
  • 最大输出128K
  • 相对延迟Moderate
查看官方模型页 ↗
03 · GOOGLE

Gemini 3.1 Pro

强调多模态、复杂问题、Agent 和“vibe coding”,当前为预览版。

  • 价格阈值200K prompt
  • 短上下文输出价$12 / MTok
  • 发布状态Preview
查看官方模型页 ↗
04 · XAI

Grok 4.5

面向 Agent 软件、工程与工作流任务,支持推理、函数调用和结构化输出。

  • 上下文500K
  • 缓存输入$0.30 / MTok
  • 输入文本、图像
查看官方模型页 ↗
05 · DEEPSEEK

DeepSeek V4-Pro

同一模型支持思考与非思考模式,兼容 OpenAI 和 Anthropic API 格式。

  • 上下文1M
  • 最大输出384K
  • 工具调用支持
查看官方价格页 ↗
06 · ALIBABA CLOUD

Qwen3.7-Max

1M 上下文的思考 / 非思考模型,人民币计价,适合国内云接入评估。

  • 上下文1M
  • 实时原价¥12 / ¥36
  • Batch官方列示半价
查看官方价格页 ↗
04 / Cost sketch

快速估算单次成本

只计算标准输入与输出 token 费,不含缓存、搜索、工具、存储、区域、Batch 或折扣。结果不是账单报价。

Estimated API cost
$1.10

100,000 输入 + 20,000 输出 tokens;标准实时费率粗估。

05 / Read before buying

价格之外的四个变量

可靠性不是参数表

模型在你自己的工具、数据和错误恢复流程中是否稳定,比单次公开榜单分数更接近生产表现。

长上下文不等于有效记忆

窗口容量只说明可接收上限;召回质量、注意力衰减、首 token 延迟和阶梯价格需要分别测试。

数据边界要逐项确认

免费层、付费 API、企业合同和云平台代理的训练使用、日志保留与区域处理政策可能不同。

总成本包含失败

输出冗长度、重试率、工具调用次数、缓存命中和人工复核,常常比每百万 token 标价更影响账单。

06 / Primary sources

只链接官方资料

模型和价格变化很快。采购或上线当天,请重新打开对应厂商页面确认。