一条30字的指令,AI写出一篇6000字长文,秘密全在知识库

一条30字的指令,AI写出一篇6000字长文,秘密全在知识库

一条 30 个字的指令,能换到什么?

我们团队实测的答案是,一篇 6000 字的成品长文。标题、结构、案例、行文风格全部到位,质量稳定,可复跑。指令原文长这样,「我想针对视频 40 发布一篇公众号文章」。没大纲,没风格要求,没字数,连写给谁都没说。

是模型突然变聪明了吗。不是。

同一个模型,没有这套系统之前,给它同样的指令,产出的是一篇结构松散、语气漂移、看两段就想关掉的文章。差距不在模型,在模型背后那套知识库工程。

今天老雷把这套东西按工程视角拆开讲。做企业 AI 落地的同行建议看完,因为「知识库怎么建」这个问题,几乎每个项目都会撞上。

第一块基石,身份是分层的,不是一句人设

大多数团队给 AI 设定身份的方式,是在对话开头写一句「你是一位资深写手」。这种做法在我们的实测里活不过三轮对话,聊着聊着,AI 就忘了自己是谁。

正确做法是把身份写进文件系统,做成分层递进的加载结构。我们跑通的版本分四层。

最外层是全局配置,只有 10 行,管最基础的事,比如思考用什么语言、是否启用深度思考。往下一层是项目层,一句「你现在是这个品牌的主笔」,进入哪个项目文件夹,AI 就切换成哪个身份。再往下是主地图,告诉 AI 整个知识库有哪几个顶级目录,品牌、工作流、工具、规范、记忆、业务,每个目录对应一种角色。最底层才是具体内容,AI 看到「写公众号」这个触发词,才去加载品牌调性文件;看到「讲技术」,才去读参考手册。

身份不是贴在对话里的便利贴,是刻在文件系统里的文身。便利贴换轮对话就掉,文身每次启动自动浮现。

这四层结构解决的是「上下文窗口」问题。AI 一次能处理的字数是有限的,把几千份文件全塞进去,注意力反而被稀释,一个人同时听十个人讲话,谁都没听清。分层加载的本质,是让 AI 只在需要时才看该看的那一层。

很多老板以为给 AI 投喂的资料越多越好。我们的实测结论恰恰相反,喂得多不如喂得对,分对层更是关键。

第二块,调性靠约束生成,不靠灵感

身份定了,AI 怎么知道用什么语气说话。

答案是把品牌的基因拆成六个维度,每个维度回答一个具体问题。身份,回答我是谁。受众,回答写给谁。风格,回答什么调调。参考,回答对标谁。产品,回答产出门罗在哪。素材,回答视觉资产在哪。

这三五份核心文件一旦就位,产出的文章会被自动锁死在一组约束里。不能写成技术拆解,因为受众不是程序员。不能写成干瘪的干货列表,因为品牌调性要求故事加类比。结尾必须连回业务,因为一切内容服务长期生态。

你在我们的文章里看到的那些场景化开头,不是灵感爆棚,是被约束出来的结果。

这带给 FDE 的启示很直接。客户问你「为什么 AI 写的东西不像我们公司」,答案几乎从来不是模型不行,是你的知识库里压根没有一份像样的品牌规范文件。先补文件,再谈效果。

这套六维卡搬到企业场景同样严丝合缝。身份维度换成企业的业务定位,受众维度换成客户画像,风格维度换成对内对外的沟通规范,参考维度放行业的标杆内容,产品维度放产品线和交付物清单,素材维度放 Logo、模板、案例库。一家企业把这六个维度的文件凑齐,通常只需要一两周的梳理,但它决定的是此后每一次 AI 产出的下限。

判断自家知识库合格与否,有个简单的土办法。随机抽三个不同岗位的员工,让他们各自描述「公司希望对外传达什么」。三个答案如果明显对不上,那知识库的品牌规范就是缺位的,AI 产出的漂移只是症状,病根在团队自己没有对齐。

六维品牌约束环绕机器人的编辑插图,表达AI身份的分层加载机制

第三块,检索要三路并发,单靠关键词必丢信息

知识库建好后,AI 怎么从中找素材。

只做关键词搜索会漏得很惨。你搜「视频 40」,文件里写的却是「第四十期」,字面匹配直接瞎掉。我们跑通的是三路并发的检索架构。

第一路精确命中,用触发词路由表直接定位目录。第二路关键词匹配,扫全库找字面包含的文件。第三路是语义检索,把所有文档提前转成语义向量,搜索词也算出向量,按距离远近找「意思相近」的内容,搜「一人公司产线」,能召回全文没出现过这四个字、但就在讨论这件事的文件。

三路结果汇总后,再过一个重排序器按相关度精排,把最贴题的排前面。

老雷给你划下重点,拉开项目差距的从来不是模型本身,是你给模型看的上下文质量。同一个模型,喂对上下文是持续成长的合作者,喂错就是聪明但失忆的天才。

三路检索支流汇入精排漏斗的插图,表达精确、关键词、语义三路并发检索架构

第四块,记忆要沉淀成文件,不能靠对话记性

AI 有个致命毛病,没有持久记忆。这次对话告诉它「别用问句开头」,它记住了。下次新开对话,忘光,又开始问句连发。

解法是把记忆沉淀成文件。我们用了四个文件,各管一种记忆。规则文件,沉淀行为约束,比如代码必须标类型。偏好文件,沉淀用户习惯。项目文件,沉淀进度状态。外链文件,沉淀外部资源地址。这四份文件在每次启动时自动进入工作记忆,不需要 AI 主动去查。

更省心的地方在于,这些记忆不用人手动维护。现在的 AI 编程工具自带自动记忆功能,对话里出现「踩坑」「下次注意」「我偏好」这类话,会自动记录。再配一个后台脚本把记录拉进暂存区,交给一个便宜模型批量审查,判断这条是规则还是偏好、跟已有的重不重复、格式对不对,审查通过才晋升进正式文件。

整个过程无人值守。这就是长会话里 AI 不「精神分裂」的原因,规则是被约束进来的,不是靠提醒的。

第五块,外部信息入库,必须过五道闸门

最后一块,也是最容易被忽略的,外面的信息怎么进知识库。

直接贴链接?不行。这是我们踩过坑后立下的铁律。所有外部信息,PDF、网页、截图,一律先进一个收件箱缓冲区,走五道阶段,待处理、提取、生成入库提案、审批入库、源文件归档。

像海关通道。货物不能从码头直接搬进客厅,得先进大厅、拆包检验、开申报单、盖章放行,空箱归档。每一步有记录,能回退,有责任人。

为什么这么严。因为真实发生过,工具一激动,把一篇随手转发的低质长文原文写进了知识库。下次 AI 被调用,垃圾内容在上下文里挤掉了真正有用的品牌规范,整条产线的输出质量当场崩掉。

越约束越聪明。自由的 AI 在垃圾信息的海洋里迷路,被约束的 AI 只喝得到过滤水。

配套的还有一层自动化。这套记忆、收件箱、审查体系,没有任何人在管。靠的是 Hook 机制,一个门铃加联动的编程概念。新记忆产生,门铃一响,走廊灯亮、扫地机启动,该跑的脚本自动跑。企业级落地里,这套无人值守的联动,才是知识库能长期活下去的原因。

回头看这条 30 字指令的完整链路,AI 做了五件事,分层加载身份,按品牌约束调性,三路检索找素材,四色记忆防跑偏,五道闸门保质量。

每一件都不炫技,全是朴素的文件工程。但拼起来,就是「30 字进、6000 字出」的确定性。

这套系统上线至今跑了上百次产出,维护动作只有两件,每周期性审计一次文件结构,把过时规范下架;新踩的坑当天写进对应记忆文件。知识库是活的系统,放养必荒。

给 FDE 同行的行动建议就三条。先给客户的知识库画四层加载结构,别再堆一个大文件夹。再立四份记忆文件,把约束沉淀下来而不是每次口头交代。最后给外部信息修一条五阶段的入库通道。这三步做完,你交付的就不是「能聊的 AI」,而是「稳定的数字员工」。

写着写着想到图书馆学。这门学问存在了一百多年,干的事始终是一件,给无序的信息建索引、定分类、设门禁,让知识可被精确找到。今天的 AI 知识库工程,不过是这门老学问的新场馆。

这门学问不老,只是换了个馆员。

文件穿过五道安检闸门的插图,表达外部信息入库的五阶段质量管控