越聪明的模型越贵,越该干粗活还是细活?九成企业把这笔账算反了
2026-08-21
前两天有个佛山做家具的老板拉住我,一脸郁闷:“江天,我花大价钱买了某海外旗舰模型的企业版,让助理把 Excel 和生产日报丢进去,让它帮我写每周经营分析报告。报告写得是真漂亮,排版工整、措辞专业,我差点就信了。”
我问他:“后来呢?”
他说:“月底一对数,全错。它不知道’已接单未排产’和’已排产未入库’是两回事,把俩数加一块当’在制品’;它把返工率上升归到’员工不熟练’,其实是某批板材供应商质量波动;最离谱的是,它建议我扩大爆品产能,压根没看见那爆品占着瓶颈设备——喷涂线,结果把别的高毛利订单全拖延期了。”
我听完就笑了。这不是模型不聪明,是你的账算反了。
你以为你买的是”分析能力”,其实你买的是”一台很贵的打字机”,还让它去干本该由仓库管理员干的体力活。
大部分企业上 AI,第一反应是”选哪个模型最强”。ChatGPT、Claude、Gemini、DeepSeek、通义千问、Kimi、豆包,还是本地部署开源模型?比榜单、比参数、比上下文长度、比价格。这个问题听起来特别专业,但我要直说:问错了。
经营分析报告不是聊天记录。跑完一份像样的报告,至少要干七件事:把 ERP、财务、CRM、电商、投放、库存、门店、供应链的数据拉到一张桌子上;把老板看得懂的口径定义清楚;找异常;做归因;写报告;每个结论能追回原始数据;最后变成下周的具体动作。
你盯着这七件事看,有几件是”聪明活”?没几件。绝大部分是脏活、重复活、体力活——清洗格式、提取字段、分类匹配、跨表汇总。这些活,用最便宜的小模型干,又快又稳又省钱。只有”把分散的事实合成一段有逻辑的经营叙述”“对异常做归因假设”这两三件,才值得请旗舰模型出马。
所以正确的问题,从来不是”哪个模型最强”,而是”我的报告卡在哪个环节,哪个模型组合能把这个环节从人肉劳动变成可验证的自动化”。
我把它叫”模型分工三明治”,从上到下三层:
底层,便宜模型干粗活。DeepSeek、Qwen 这类开源或轻量模型,专门批量处理:把生产日报从文字转成结构化表、把 PDF 发票提取出金额和日期、把银行流水和应收台账做匹配分类、把几千条店长日报做成摘要。几千条流水,几毛钱跑完,干净利落。
中层,规则和 BI 把口径焊死。用 Superset、Metabase、Power BI 把每个指标的计算口径固化下来,AI 不能自己改。在制品只包含”已排产、未入库”的工单;OTD 准时交付率按订单确认交期算,不按发货;良率不含返工后合格品。这一层是护栏,防止聪明的模型一本正经地胡说。
顶层,旗舰模型做综合。Claude、GPT 这类,把各部门的事实摘要拼成跨部门的经营叙述,每个结论带数据引用,对异常做归因假设——但必须老老实实声明”我的分析基础是什么、我不确定的是什么”。
佛山那家家具厂,年营收 3 亿,就是这么改的。原先买旗舰模型账号,助理把 Excel 丢进去总结,报告漂亮,三个数错。改造后:DeepSeek 每日清洗生产数据,Claude 每周生成报告,工程师只审异常项。周报准备从 2 天降到 4 小时,OTD 分析粒度从”月度”提升到”每日订单级”,还提前发现一条装配线的产能瓶颈,避免了一个大客户的延期违约。
某汽车零部件制造商,年产值 8 亿。原来每周经营报告要 3 名工程师花 2 天整理。改造后 DeepSeek 每日清洗,Claude 每周出报告,工程师只审异常。周报 2 天变 4 小时,提前发现装配线瓶颈。
某电子代工厂,800 人、6 条产线,专攻设备稼动率。IoT 实时采产线状态,DeepSeek 每日自动生成停机原因分类报告,Claude 每周出稼动率瓶颈分析,找出哪条线、哪个时段损失最多产能。整体稼动率从 71% 升到 79%——相当于多了 1.1 条虚拟产线产能,没花一分钱固定资产。
这里头有几个坑,我见一次说一次。
第一,用旗舰模型直接处理生产数据,它不懂制造业口径,还贵。批量脏活用便宜模型就够了,别拿兰博基尼当拖拉机开。
第二,AI 报告没有”不确定性说明”是定时炸弹。制造业的原因往往很复杂,AI 必须告诉你”我的分析基础是什么、我不确定的是哪”,否则你不知道该质疑哪句。
第三,设备异常的根因分析——五问法、鱼骨图——必须工程师在场,AI 只能辅助,不能替你拍板。把根因全交给 AI,迟早出事。
带走一句:制造业不是缺模型,是缺业务口径。没有口径,越聪明的模型越会一本正经地误导你。
再往深说一层。制造业的核心口径,AI 接进来前必须先定好:OTD 准时交付率,按实际交付日不超过承诺交付日的订单比例算,别和”发货率”混;良率,首次检验合格品数除以总产出,不含返工后合格品;返工率,按工序分开统计,别合并;设备稼动率,实际生产时间除以计划生产时间,停机原因要分类——计划维护、故障、等待;库存周转天数,原材料、在制品、成品分别计算。这些口径写不清楚,再聪明的模型也是瞎算。这一层用规则和 BI 焊死,AI 改不了,才是模型分工里最稳的地基。
财务那头也一样。“解释数字”这件慢活,让小模型先跑差异分析初稿,旗舰模型合并成 CFO 口径叙述,每个结论带引用,财务从”写报告”变成”审解释”,时间从数天缩到数小时。会计对账让 AI 做分类匹配、不做最终判断:高置信度自动确认、疑似人工确认、未匹配优先处理,工作量降六到八成,每条操作留日志,审计能还原每一步。
你算一笔账就明白,为什么九成企业把这笔账算反了。一份周报,清洗和匹配占了七成工作量,这些交给便宜模型,成本几乎可忽略;真正吃算力的是”合成叙述”和”归因假设”,只占三成,才值得旗舰出马。反过来,你拿最贵的旗舰去洗几千条流水,等于请主任医师去扫马路——钱花了,活还没扫干净,因为它根本不擅长这种重复脏活,反而容易在无聊里出错。
模型分工的本质,是承认一件事:AI 不是一个人,是一支分工明确的队伍。你当老板的,得是先搭组织架构的那个人,不是只会喊”给我上”的。我从不替客户先选模型,而是先问他:“你每周最痛的那件经营分析活,到底卡在哪个环节?”环节卡准了,模型组合自然就清楚了。
模型分好工了,钱花对地方了,下一个问题马上冒出来:你给员工用的,到底是你采购的合规工具,还是他们自己偷偷找的个人账号?
下一篇,我讲一个真事——有个老板发现,财务把一张写着客户名称和金额的表格,截图传进了个人 ChatGPT。
发表评论: