无尘阁日记

无尘阁日记

一个招投标情报系统,是怎么自己长出证据链的
2026-10-10

接着上篇。上篇讲了”为什么 RAG 救不了经营分析”,这篇我把它落到一个具体的东西上:我们给一家 ToB 企业搭的招投标情报系统。

先别划走,说个销售最懂的痛:不是没线索,是线索来了你不知道哪个真、哪个值钱、哪个跟自己业务半毛钱关系没有。我们这套系统,现在每天凌晨 4 点自己爬招标网,把”跟客户业务画像匹配度超过 80%“的标自动发邮件提醒——而且每一个结论后面,都挂着一条证据链,人审过才进库。这篇讲方法。

一、情报系统,是知识工厂第一个落地的 skill

江天当时给我定位:“情报系统就是一个 skill。”后来我们俩对细节,发现一个 skill 底下其实藏着好几类核心能力。比如其中一类——“新出来的标,跟这家客户的业务关联度有多大”,这本身就是一种思考能力。但不管怎么拆,它解决的是同一件事:把公开的招投标信息,变成客户能用的商机情报。

具体抓三层:

第一层,新招标及时通知。中国招投标网、政府招投标网公开抓取,新的标一出来就推给客户的大客户团队。

第二层,历史招投标分析。哪些中了,哪些被对手(比如宝武、首钢这种大客户的大客户)抢走了——重点分析”为什么丢标”。

第三层,竞争对手近期的人财物变动。对手最近招什么人、调什么结构、有什么风险,全盯。

二、本体对象是地基,三元组是砖

光爬数据没用。我们把”招投标”“发现商机”相关的对象,抽成三元组——主谓宾,比如(竞争对手 A — 近期 — 业务变动)。建了几十个这样的本体对象。

关键点还是上篇说的:这些对象、关系、属性,是人工审核过的,是确定的。不是大模型现编的。

有了这座地基,系统才能干下面这件聪明事。

三、KIQ:让系统自己问出情报

我们做了一个 KIQ(关键情报问题)的入口。人不用写复杂的检索式,就问一句大白话:“我的竞争对手最近有什么业务变动?”

系统会自己干四步:自动关联本体库里这家客户的”竞争对手”对象 → 去实时搜索、抓取公开信息 → 把业务画像、竞争对手画像、实时信息一起交给大模型 → 大模型给出结论,而且结论下面挂着证据:为什么得这个结论、证据链是怎么样的。

人可以对证据进行审核、评级。觉得靠谱,确认一下,这条证据就入本地库。下次再生成类似结论,会优先参考这些被人工确认过的证据。

这一步,是”不胡说八道”的根本。大模型不是在裸奔,它每抛一个结论,都得把理由摊在你面前,你点头它才记。

四、闭环到推送:匹配度 80% 才发声

系统不是给你一个大屏看热闹的。我们设了阈值:当抓到的标,跟客户业务画像的匹配度达到 80% 甚至更高,才自动发邮件。

后续还能接短信、接微信服务号——在微信上直接给客户发通知都行。具体接哪个,看现场实施时客户要什么。

也就是说,从”爬数据”到”出结论”到”推到人”,是一条全自动的链,中间只有”证据审核”这一环需要人点一下头。

五、实施三步法:本体材料从哪来

江天当时逼我把”到客户那怎么落地”说细。我总结成三步,每一步都是在喂本体对象:

第一步,大量采访沟通。跟客户的人聊,这个沟通的过程本身就是本体对象的原始材料。

第二步,要客户的过往文件。会议材料、沟通记录、发的文件、内部的规章制度——凡是跟他要实施的系统密切相关的,全拿来当本体原料。

第三步,人工录入现场材料。比如去招投标现场录了音,转成文字传进去,结合外部信息和他自己已打底的投标报告,一起分析”为什么丢标”。

这三样进库之后,让大模型提取本体、提取关系、人工审。路径一旦跑通,换一家公司,只要按他的业务现场重建本地对象就行——建好的那套不够用,得补。

六、顺手还做了两件事

人才库框架:抓 Boss 直聘、猎聘,看竞争对手最近在招什么岗、岗位要求是什么规模——反过来推他业务往哪个方向走。这块做了,但没账号拿不到 API 数据,就先停在那。

客户咨询对话提取:企业微信群里跟客户聊的内容,以前靠李雪老师手工整理。我们做了个后台客户列表,AI 按五点自动提取——痛点、期望、背景信息、优缺点、QA 文档——直接入库存成页面,不用再手工抄。这块也实现了八九成。

七、两个躲不开的坑

第一,反爬。有些招标站有反爬机制,有些要账号登录。

第二,要钱。企查查的股东、法律、违约风险信息,得客户自己掏钱买 API 接进来。

这两个坑告诉我一件事:能自动化的,是”路径”;不能自动化的,是”每个客户独有的那层关系和那笔买数据的钱”。别指望一套系统打天下。

八、再往前一步:五个子系统

江天当时还画过一张更全的图——情报系统后面,还连着一长串,大概五六个子系统。我们这回只把”情报系统”作为本体对象第一次落地,先把这一块跑通、跑实。后面的那些,得基于”提取本体关系”这套方法,一个一个落地成系统。

但前提永远一样:落地要有三方面的材料——外部能抓取的、内部能提供的大量资料、以及人工录入的现场材料。缺一样,本体就不完整,结论就飘。

九、一个真实查询,是怎么跑完的

拿我们验证时用的例子说一遍。客户的大客户是宝武、首钢这类。系统每天凌晨爬中国招投标网、政府招投标网,做三件事:第一,新的招标信息及时通知;第二,历史的招投标——哪些中了、哪些被对手抢走,分析为什么丢标;第三,竞争对手近期的人财物变动。

当人用 KIQ 问”我的竞争对手最近有什么业务变动”,系统自动关联本体里的”竞争对手”对象,去实时搜、抓公开信息,把客户业务画像、对手画像、实时信息一起喂给大模型,给出结论并挂证据。人审完觉得靠谱,这条证据入本地库,下次同类问题优先参考。

整个链路里,爬数据是机器干的,出结论是机器干的,唯独”证据靠谱不靠谱”这一下,是人点的头。这就是它敢被拿去拍板的原因。

三句话自检

  • 我的 AI 系统,出的每个结论后面挂证据了吗?还是只给一句话让我自己信?
  • 我的数据,是”爬下来就完事”,还是建成了”对象—关系—属性”的本体?
  • 我敢设阈值吗?匹配度不够的,敢不让它出声吗?

情报系统的灵魂不是”爬得多”,是”说得清、推得准、不乱叫”。如果你也想搭一个,别先写爬虫,先把”这条业务链上有哪些对象、它们之间什么关系”写清楚——那是地基,爬数据是上面的楼。