DeepSeek V4 Flash 0731 这两天在 Hacker News 上冲到数百票,不是因为它又讲了一个“国产模型追上谁”的故事,而是因为一组更难忽略的数字:ARC Prize 页面显示,它在 max effort 下拿到 ARC-AGI-1 Semi-Private 89.0%、ARC-AGI-2 Semi-Private 61.4%,单题成本分别约 0.02 美元和 0.04 美元。

我的判断:这条新闻真正刺痛闭源大模型的地方,不是某个榜单位置,而是“能力、价格、开放权重”这三件事开始被放在同一张工程账本上比较。

榜单热闹,账本更刺眼

ARC-AGI 的分数不能直接等同于日常工作能力。它测的是抽象推理和新任务适应,不是客服、写代码、写报告的全流程体验。可它适合暴露一个问题:如果一个开放权重模型已经能在这类测试里拿到可看的分数,企业就会重新问,哪些任务还必须交给最贵的闭源 API。

Artificial Analysis 给出的另一组指标更接近日常选型:DeepSeek V4 Flash 0731 的 Intelligence Index 为 52,在其统计的 101 个模型中排第 3;输出速度 112.8 tokens/s,排第 10;标价为输入每百万 tokens 0.14 美元、输出每百万 tokens 0.28 美元。更夸张的是缓存命中价格,页面列为每百万 tokens 0.003 美元。

这些数字放在一起,含义就变了。模型公司过去可以说“最强能力天然最贵”。现在更像是:强能力仍然贵,但不再天然只能由少数闭源入口定价。价格压力开始从宣传页进入采购表。

开放权重不是免费午餐

Hugging Face 的模型页显示,DeepSeek-V4-Flash-0731 是开放权重模型,标签包含 MIT license、safetensors、fp8、8-bit 和 1M 上下文相关论文信息;页面还显示总参数约 304B,并列出多个可部署提供方。这对开发者有吸引力,因为它把“能不能自己控部署”从愿望变成选项。

但这里有个容易被忽略的边界。开放权重降低的是议价门槛,不自动降低运维难度。你要处理推理吞吐、显存、上下文缓存、模型更新、评测回归,还要接受它在不同任务上的不稳定。Artificial Analysis 也标出它很 verbose,输出多有时是能力,有时就是成本和延迟。

所以它不是把闭源模型一脚踢出市场。更准确地说,它把闭源模型的溢价理由逼得更具体:你不能只说“我们更强”,还要说明你在可靠性、工具调用、企业权限、审计、延迟和服务承诺上多出来的那部分钱值不值。

普通公司该看哪一笔账

如果一家公司只是偶尔用 AI 写文案,DeepSeek V4 Flash 这类模型的变化未必马上改变什么。真正会先动的是高频、可评测、边界相对清楚的工作:代码辅助、批量分析、结构化推理、内部知识检索、长上下文处理。

这些场景有一个共同点:调用量大,错一次可以复核,省下来的不是一次订阅费,而是长期推理成本。模型能力越接近,账单越敏感;账单越敏感,开放权重越有筹码。

这件事短期看是 DeepSeek 又刷了一轮榜。长期看,它在提醒所有 AI 应用公司:护城河不能只建在“我接了一个最强模型 API”上。只要底层模型的价格和能力继续被公开比较,上层产品就必须拿出更难复制的工作流、数据闭环和交付质量。

消息来源

  • ARC Prize:DeepSeek V4 Flash 0731 评测结果,https://arcprize.org/results/deepseek-v4-flash-0731
  • Artificial Analysis:DeepSeek V4 Flash 0731 性能、速度与价格页面,https://artificialanalysis.ai/models/deepseek-v4-flash
  • Hugging Face:deepseek-ai/DeepSeek-V4-Flash-0731 模型页,https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
  • Hacker News / Algolia:DeepSeek V4 Flash 0731 在 2026-08-07 获得数百票讨论,https://hn.algolia.com/?q=DeepSeek%20V4%20Flash%200731

Categorized in:

个人日志,

Last Update: 8 8 月, 2026