微调到底改了什么,一百篇文章喂出来的文风实测
先看同一段「儿童发展心理学」的两种写法。
微调前的模型这么写。第一阶段,0 到 1 岁,信任还是不信任。一个嗷嗷待哺的婴儿,他的整个世界就是妈妈的怀抱,他饿了哭了,妈妈及时送上温暖的乳汁,每一次及时的回应,都在婴儿心里刻下一个信念,这个世界是安全的,我是被爱着的。
知识是对的,表达是标准的,读起来像一页写得还不错的教材。
微调之后,它这么写。第一关,0 到 1 岁,信任的种子。一个嗷嗷待哺的婴儿,他的世界里只有一件事,我安全吗,我能相信这个世界吗。而你,就是他的全世界。你每一次及时的喂奶,每一次温柔的安抚,每一个温暖的拥抱,都在告诉他,宝贝,你是被爱的,这个世界是安全可靠的。
信息和逻辑一点没少,味道完全变了。这中间隔着的,是一百篇文章的微调。这篇把这次风格迁移实测从头到尾摆开,看微调到底动了模型的什么。
这组实测是怎么搭的
为什么非要动微调,先交代一下背景。在做这次实验之前,风格注入的常规做法是往提示词里塞人设,把经历、观点、写作特征全部写成指令。这条路走得通,但越走越沉,提示词越写越长,上下文被挤得越来越满,而且每次调用都得把这几千字的人设重新传一遍。老雷自己试下来的感受是,人设描述写得越细,模型越像在背课文。
所以这次直接换了条路。收集一百篇风格鲜明的女性作家文章当训练数据,在 Google Vertex AI 上微调 Gemini 2.5 Pro,然后把微调前后的模型放在同一批主题下各自写一遍,摆在一起比。
验证主题特意挑得很散,电影、明星、综艺、财经、历史、游戏、科技、社会、星座,从威尼斯电影节获奖写到黑暗之魂,从资产代币化写到淘宝九块九的 DeepSeek。横跨这么大的面,就是想看清一件事,模型学到的到底是几句口头禅,还是一整套写作方式。
先说结论,是后者。有几个地方甚至超出了预期。下面从浅到深一层层拆给你看。
表面的风格,全学到了
按从浅到深的顺序摆几篇输出。
最浅一层是语汇和姿态。给它「威尼斯电影节获奖」这个题,它没有写「某演员获奖」的客观报道,开头是「这一刻我承认我有点心疼她」,第一人称直接下场,主观情绪全在里面,读起来像朋友在跟你聊天,不像媒体在发通稿。
再深一点是立场和胆量。韩剧台词争议的题,它张嘴就是「说实话挺活该的」,观点鲜明,用词尖锐,一点不和稀泥。这种敢下判断的狠劲,恰恰是提示词最难稳定复现的东西,提示词里写「请保持犀利」,出来的东西多半是装的犀利。
第三层开始动叙事技巧了。综艺《姐姐当家》里一对夫妻被全网劝分的题,它用的是故事化铺陈,细节描写加戏剧化反转,在人物经历里制造悬念和情感张力,读着像在追一篇连载。科技题也一样,「小米跳过 16 直接发 17」这个题,它的标题是「消失的16与硬刚苹果的小米17,雷军藏了哪些小心思」,设问加信息留白,钩子下得很熟练。
第四层开始动思维结构了。演员手撕前东家的娱乐八卦,它没停在八卦层面,而是把明星的处境映射到每个职场人身上,落点是「当一份工作从滋养你变成消耗你的时候,拿出老子不干了的勇气」。从个案延展出普世的共鸣,这是组织信息的方式变了。历史题也是同样的路数,写张居正,落点不在功绩清单,在对改革者命运的描摹,结尾上升到人性规律和人生警示。
第四层最意外。给它「资产代币化」这个纯金融技术题,它写的是「今天我不谈冰冷的技术,我想带你认识这场革命背后三位正在悄悄改写游戏规则的女性」。一个冷冰冰的技术话题,硬是被写出了女性主义的温度。这种「跑题」恰恰是微调的价值,它不是在执行指令,是在用学到的思维模式重新组织信息。
压轴的是黑暗之魂。题目写成「失败一万次,我才学会和痛苦共处」,结尾落在「战胜的不是 Boss,而是那颗被挫败感吞噬的自己」。把游戏体验升华成人生感悟,借文学和自然的意象把抽象情绪具象化,这是训练数据里埋得最深的那部分东西,也被迁移出来了。
还有一个容易被忽略的细节,标题的画风也整体变了。「辛芷蕾封后,献给每一个曾被嘲笑梦想的你」这种带情绪召唤的标题,「全是预制菜的萨莉亚,为什么大家偏不骂它」这种反差设问,都是微调前那个一本正经的模型憋不出来的。标题是文风最外露的地方,连它都换了人格。
六篇摆完,规律很清楚,模型学到的不是几句标志性的话术,是一整套从视角、立场到组织方式的写作操作系统。

前后摆在一起,差在四个维度
回到开头那段儿童心理学,把前后差异拆开看,集中在四个维度上。
亲密感,微调前是客观叙述,读者是个旁观者,微调后直接用「你」对话,读者被拉进来当了当事人。隐喻,微调前是解释和科普,微调后满篇「信任的种子」这类意象,文学性上了一个台阶。情绪价值,微调前像教材,知识清楚但没有共情,微调后像一位懂心理学的母亲在给你写信。风格指纹,微调前平铺直叙,微调后是温柔而坚定的语气、三拍子的句式节奏、对比反转的收尾,指纹清晰到能拿去当验收标准。
那个三拍子不是玄学,回头看开头引用的那句,「你每一次及时的喂奶,每一次温柔的安抚,每一个温暖的拥抱」,三个排比,节拍器一样准。这种句式层面的特征,是最难用提示词描述、又最容易被数据教会的东西。
微调改的不是模型会说哪些话,是模型看世界的方式。

能下的结论和下不了的结论
这组实测跑完,有三条结论敢下。
第一条,风格真的能烙进权重。提示词也能让模型模仿风格,但越具体的风格提示,写出来的东西越像在「表演」风格,微调出来的模型是「有」这个风格,两者的差别读者一眼就能看出来。
第二条,深层思维模式也能迁移。第一人称、犀利批评这些表面特征学到手不稀奇,把明星事件映射到职场、把游戏升华成人生这种深层模式也跟着迁过去了,这是这次实测里最值钱的发现。往深里说,一篇好文章的骨相是思维方式,皮相才是词句,微调连骨相一起动了。
第三条,一百篇风格鲜明的文章,效果好过一千篇风格混杂的。想复现这个实验,力气要花在挑文章上,不是凑数量上。
也有下不了结论的地方,得说清楚。这次验证的是单一风格的深度迁移,一个模型一种文风,多风格切换没测。长篇输出下风格的一致性没做系统验证。样本就一百篇,更大数据量带来的边际收益在哪,不知道。
顺带交代一下这次实测没怎么展开的部分。微调的价值不止风格塑造,统一写作标准、注入专业知识、强化垂直能力,都是同一条技术路线能顺带办的事。准备数据阶段产出的一份素材需求报告给我的印象很深,收集哪几年的稿子、留哪些主题、剔除什么风格,都列得清清楚楚,这个报告本身就能当团队内容资产盘点的模板用。模型之外,这些配套动作才是工程量的大头。
老雷给要做验收的工程师提个醒,验风格微调别问「像不像」,把风格拆成维度逐条对,人称姿态、隐喻密度、句式节奏、情绪温度,一条条过。开头那段对比里的四个维度,直接可以拿去当第一版验收清单。
一个成熟创作者的风格和判断力,过去锁在他脑子里,现在有了一条变成数字资产的路径。
老雷给内容团队的建议是,先别管微调的技术细节,从今天开始把你最拿手的那一百篇稿子存好、标好,主题、发布数据、读者评论都留痕,那是未来所有数字分身的原料。模型和工具每个月都在换,数据永远是你的。
