首页 - 评测 - “便宜没好货”已成过去式 DeepSeek任务成本仅3美分

“便宜没好货”已成过去式 DeepSeek任务成本仅3美分

时间:2026-08-11 浏览:17 来源:CNMO


中国人工智能模型正在以惊人的速度缩小与OpenAI、Anthropic等前沿模型的性能差距,同时在“性能比”(即任务成本)这一关键指标上展现出压倒性优势。近日,据独立AI模型评估平台Artificial Analysis(AA)发布的数据,在全球前20大AI模型中,DeepSeek V4 Flash以单任务仅3美分的成本成为最经济的选择

DeepSeek
DeepSeek

性能差距加速收窄,中国模型跻身第一梯队

  长期以来,中国AI模型以低价策略参与市场竞争。然而随着近期月之暗面Kimi K3、阿里巴巴Qwen 3.8 Max等模型的发布,中国模型已批量进入AA模型综合智能指数前10名。若将范围扩大至前20名,上月底发布的DeepSeek V4 Flash同样在列。

  在智能指数60分以上的顶级模型中,唯一上榜的开放权重模型是月之暗面Kimi K3(60分) 。Kimi K3与当前智能指数排名第一的Claude Opus 5(63分)仅差3分,与GPT-5.6 Sol仅差1分,而其任务成本仅为84美分,在前沿模型中属于较低水平。

“便宜没好货”已成过去式 DeepSeek任务成本仅3美分

任务成本:企业AI支出的真实标尺

  在AI模型成本评估中,令牌单价并非全貌。推理模型在回答前会消耗大量内部“思考”令牌,因此即便令牌单价低廉,单任务的总体成本仍可能偏高。“任务成本”更能反映企业实际支出——即完成特定工作所需的总令牌消耗量。

  DeepSeek V4 Flash的智能指数为52分,与OpenAI GPT-5.6 Luna(max模式)持平,而任务成本仅3美分,略低于后者的5美分。更为关键的是,DeepSeek V4 Flash的首字响应时间(TTFT)为1.17秒,端到端响应时间为19.49秒;而GPT-5.6 Luna(max)的TTFT长达135秒以上。两者智能指数和任务成本相近,但DeepSeek的响应速度优势极为显著。

响应速度与商业模式的双重优势

  在响应速度的对比中,Claude Opus 5表现突出:TTFT为5.92秒,端到端响应时间仅14.68秒,整体耗时仅为同级模型的四分之一。

  此外,DeepSeek V4 Flash为开放权重模型(MIT许可证),允许企业自行托管;而GPT-5.6 Luna仅为API专用。这一差异在实际部署中可能对开发者的选择产生重要影响。

  阿里巴巴新发布的Qwen 3.8 Max拥有2.4万亿参数,智能指数达58分,位列第10,印证了阿里巴巴“历代最强Qwen”的说法。但其任务成本为1.13美元,高于同级别竞品。

  在1美分任务成本区间,GPT-5.6 Luna(low模式)、MiMo-V2.5和Llama 4 Scout均位列其中。其中MiMo-V2.5(智能指数37分)在同价位模型中性价比最高。

“便宜没好货”已成过去式 DeepSeek任务成本仅3美分

企业AI成本井喷:Uber年度预算4月即告罄

  企业AI支出的快速增长正成为行业普遍现象。据《福布斯》5月报道,Uber因开发人员对Anthropic Claude Code的使用量激增,2026年全年AI预算在4月份即全部耗尽。约5000名工程师组成的组织中,Claude Code的快速普及使AI支出远超预期,Uber随后为每位员工设定了每月1500美元的代理式编程工具使用上限。

  亚马逊也面临类似困境。其内部AI项目利用Anthropic Claude Sonnet进行商品列表与作者信息比对,项目成本超出原始预算860%,达到约180万美元。更大的问题在于,令牌使用带来的成本增长在长达5个月内未被及时发现。

  随着AI模型在企业内部快速扩散,尤其是向代理式功能和推理型任务转型,AI令牌成本正急剧攀升。模型开发商纷纷通过降低令牌单价或引入“提示缓存”技术来应对,但缓存命中后仍需付费,且上下文越长累计成本越高。缓存失效(如对话间隔超过5分钟、修改历史消息)将导致费用按原价重新计算。

“便宜没好货”已成过去式 DeepSeek任务成本仅3美分

  AA的智能指数是一个复合指标,综合了GDPval-AA v2、τ-Bench Banking、Terminal Bench 2.1、SciCode、HLE、GPQA Diamond、CritPt、AA-OmniScience、AA-LCR等9项评估的加权结果。任务成本则基于每个模型在9项评估中实际消耗的令牌量(含输入、缓存命中、缓存写入、推理、输出)乘以令牌单价计算得出。需要指出的是,该指标以编码、数学、科学和代理式任务为基准,不适用于纯翻译、聊天机器人或一般办公场景。


相关推荐