• 我把公司AI模型从Anthropic切到DeepSeek,CFO以为我搞了诈骗——每月账单少了87%
  • 发布于 18小时前
  • 2 热度
    0 评论
  • 科叼
  • 3 粉丝 340 篇博客
  •   

上个月底,CFO拿着账单冲进我办公室:"你是不是偷偷把我们的AI服务退了?这个月费用怎么从14万美元降到1.8万?"
我说没退,只是换了个模型。
他盯着屏幕看了十秒钟:"这不可能。"
我们是一家做企业知识管理的SaaS创业公司,团队38个人,核心技术能力是对接大模型API做文档解析、智能问答和合规审查。之前一直用Anthropic的Claude Opus系列,每月API费用稳定在12-15万美元之间。
说实话,效果确实好。但费用也确实高。

转折发生在5月底的一次投资人会上。我们的A轮领投方问了一个很直接的问题:"你们的毛利只有42%,AI成本占营收的31%。如果竞争对手用更便宜的模型,你怎么打价格战?"


我当场说不出话。
回去之后我开始认真算一笔账。我们的API调用场景大概分三类:
第一类,文档解析和结构化提取——日均处理2万份文档,占Token消耗量的55%。这类任务不需要顶级推理能力,中等模型就能搞定。
第二类,智能问答和对话——日均3万次对话,占Token消耗量的30%。需要较好的理解能力,但不需要最前沿的推理。
第三类,合规审查和风险分析——日均800次,占Token消耗量的15%。这是真正需要顶级推理能力的场景,涉及法律条款的精确解读。

我之前是"一刀切"——三个场景全用Opus 4.7,每百万Token收费25美元。就像请了一个米其林三星厨师来炒蛋炒饭。


6月初,我开始做分层替换实验。
第一层(文档解析):换成DeepSeek V4 Flash。每百万Token只要0.18美元——是Opus的1/138。我当时的预期是"效果会差一些,但能接受"。
结果让我震惊了。在文档解析这个场景里,DeepSeek V4 Flash的准确率只比Opus低了2.3%——从97.1%降到94.8%。但成本降了98.7%。
第二层(智能问答):换成Kimi K3。这个模型有100万Token上下文窗口,处理长文档问答特别有优势。而且它的价格在同等能力模型里几乎是最低的。
准确率从95.2%降到93.6%,但用户满意度反而提高了0.5个百分点——因为Kimi的上下文窗口更大,能一次性处理更长的文档,回答更完整。
第三层(合规审查):保留Opus 4.7,但只在真正需要深度推理时调用。我把调用频率从"每次请求都用"改成"先过一遍轻量模型筛选,只有复杂case才调Opus"。

这一个改动,Opus的调用量直接降了72%。


对了。顺嘴提一句,技术大厂,前后端-测试机会,全国一线及双线城市均有坑位,待遇和稳定性还不错,感兴趣看看。



最终数据对比:

指标
替换前(全Opus)
替换后(分层策略)
变化
月度API费用
$142,000
$18,460
-87%
文档解析准确率
97.1%
94.8%
-2.3%
问答满意度
4.2/5
4.25/5
+0.5%
合规审查准确率
96.8%
96.5%
-0.3%
毛利
42%
68%
+26%

CFO看完报告,沉默了整整一分钟,然后说了一句:"你为什么不早点这么做?"

我没法告诉他,真正的触发点不是省钱——是那个投资人问我"怎么打价格战"时,我说不出话的窘迫。



给同行一个建议: 不要迷信"最强模型"。你需要的是"最合适的模型组合"。80%的场景不需要最强的模型,但你得知道哪20%的场景需要。

用户评论