把Gemini微调做成交付件,五步走加一份验收清单

把Gemini微调做成交付件,五步走加一份验收清单

微调项目最容易翻车的地方,不在训练那一步,在动手之前。不少团队花两三周标注数据,模型也训出来了,效果不达预期,回头一查才发现,一个精心调过的提示词就能拿到九成的效果,微调能补的那点增量,撑不起整个项目的投入。

老雷把 Google Cloud 官方的 Gemini 微调最佳实践过了一遍,再叠上交付里攒下的教训,整理成一套五步走加一份验收清单,给真正要下场动手的工程师。整篇的立场先放在这,微调是个迭代活,别指望一次到位。

动手前先过四道闸

第一道闸,目标要量化。「让模型更聪明」不是目标,「客服回复准确率从七成提到九成」「营销文案风格匹配度从三分提到四分」才是。没有量化目标的微调项目,极易掉进无限调优的死循环。

第二道闸,替代方案先穷尽。动手前花一到两天认真优化提示词,拿基线数据对比。老雷见过花几周准备微调数据的团队,收尾时发现提示词就能到九成效果。判断标准给清楚,提示词能拿到八成以上满意度就收手,微调的价值在那剩下的两成,而且这两成还要持续的数据投入来维持。需要引用外部知识库的,那是 RAG 的活,不是微调的活。

第三道闸,预算盘人力。微调的成本大头常常不是训练费,是数据准备。实测参考,一百条高质量标注数据大约一到两天人工,五百条要一周左右。提前把人力和时间排进去,别项目中途发现资源见底。

第四道闸,合规和脱敏。训练数据涉及用户隐私或敏感信息的,先脱敏先过审。Vertex AI 提供加密和访问控制,但数据本身的合规责任在你。

四道闸全过了,再动手做基线测试。拿基础模型跑至少一百条真实测试样本,用电子表格记录,每行一个样本,列上输入、期望输出、实际输出、一到五分的评分、问题分类。问题分类用这几种就够,格式错误、事实错误、风格不符、信息遗漏、过度冗长、幻觉。对每个痛点先试提示词能不能救。提示词优化之后,仍有大量样本评分低于三分,微调才值得立项。

基线没量过就开工的微调,和没验伤就开药是一个道理。

选模型,先Flash后Pro

模型选型这条不难。Gemini 2.5 Pro 综合能力最强,支持文本、图片、音频、视频、文档的多模态微调,性能要求高、预算相对充足的项目选它。2.5 Flash 响应快、成本低,训练成本大约是 Pro 的三分之一到五分之一,实时对话这类延迟敏感的项目首选。不确定就先 Flash 试水,不够再换 Pro。新一代 3.1 系列正在逐步支持微调,动手前查一眼最新的发布说明。

有个迁移提醒,Gemini 1.5 Flash-001 已经在 2025 年 5 月弃用,以前在 Gemini API 或 AI Studio 里用过微调的,现在统一走 Vertex AI。

数据是地基,质量碾压数量

数据准备是整个项目的核心,就记一句话,别追求数据量,追求数据质量。

好数据三个要素。相关性,训练数据的格式和风格要尽可能接近实际推理时的输入,做客服机器人就用真实客服对话,别拿网上扒的闲聊记录凑数。多样性,覆盖业务中八成左右的场景类型,每个类型至少十个示例,边界情况不能缺。准确性,标注错了等于请了个不靠谱的老师,越学越偏,安排多人交叉验证。

格式上,Vertex AI 要 JSONL,每行一个样本,结构是系统指令加一段对话,对话里分用户消息和期望的模型回复。2026 年的新能力是多模态数据也能进训练集,图片、音频、视频、文档都行,想微调一个能看懂业务图表的模型,现在做得到。

去重是第一要务,同一个句子抄一百遍不会让模型学得更好,只会浪费时间。三招,完全相同的直接删,相似度极高的用余弦相似度零点九五做阈值筛一遍,再狠一点用聚类把相似数据分组,每组留代表性样本。

数据量给参考区间,文本分类一百条起步、五百到一千条推荐,风格转换五十条起步、两百到五百条推荐,对话生成两百条起步、一千条以上,信息抽取一百条起步、五百到一千条,代码生成五十条起步、两百到五百条。分类任务还要注意类别均衡。

数据不够怎么办,做增强,改写同义表达、调整句式、加合理变体。实操上让另一个强模型生成变体再人工审核,比纯手写效率高五到十倍,但底线是增强数据一样要审质量,别为了凑数降质量。

微调数据质量几何插画,筛子把劣质方块挡在外,地基上只留下整齐的精良方块

指令和超参,两处最容易翻车

指令设计三条原则。其一,训练时的指令格式必须和推理时一致,训练时带了「请用 JSON 格式输出」,推理时不带,效果立刻打折,这是微调效果缩水的第一大原因。其二,指令要具体到行为层面,「写得好一点」不如「回答不超过一百字,用列表格式,每条以动词开头」。其三,把边界情况写进指令,模型遇到答不了的问题该说「我不确定」还是引导转人工,提前定好。系统指令定全局风格,实例指令管具体任务,两者结合效果最好。

超参数是控制训练过程的几个旋钮,官方推荐配置直接抄。Gemini 2.5 Pro,数据量一千条以内,训练二十轮,学习率倍数用十,适配器大小用四。超过一千条,训练十轮,学习率用默认或五,适配器还是四。Gemini 2.5 Flash,一千条以内训练轮数用默认、学习率倍数十、适配器四,超过一千条轮数和学习率都用默认、适配器用八。适配器是 LoRA 微调的秩,越大能学到的变化越多,也越容易过拟合,一般四就够。

训练效果看两个指标。总损失应该随训练逐步下降,突然上升或不降就有问题。训练集正确率很高、验证集很低,就是过拟合,减轮数、加数据多样性。老雷的经验是先全部用默认值跑一轮,看损失曲线再决定调不调。

训练账单和验收清单

账单公式很简单,训练费用等于训练数据 token 数乘以训练轮数再乘单价。拿 Flash 算笔账,一百条数据、每条平均五百 token、训十轮,总训练量五十万 token。微调后的推理定价和基础模型一致,钱只在训练环节花一次。

训练完别急着上线,验收走四层。自动指标打底,准确率、召回率、F1,分类任务必须看每个类别的分项,别只看总平均。再请一个强模型当裁判,把 Claude 或 GPT-4 配上评分标准,让它逐条给微调模型的输出打分,比纯人工快得多,还能揪出隐藏问题。然后人工抽检至少五十条,重点看基础模型经常答错的困难样本有没有改善、有没有引入新的错误模式,按准确性、相关性、风格匹配三个维度各打一到五分。容易漏掉的一层是安全,微调可能无意中让模型更容易输出不当内容,准备十到二十条对抗性的诱导问题专门测一遍。

上线前做 A/B,一部分流量走基础模型加提示词,一部分走微调模型,比真实业务指标,转化率、用户满意度、人工介入率。

上线不是终点,是第一轮迭代的起点。

交付四件套写进合同或工单,训练后的模型端点和调用文档、测试集评估报告、训练数据的版本记录、一份维护指南说清何时需要重训、怎么准备新数据。有一条纪律,永远别把效果说过头,上线前让客户拿真实场景亲自测,给一周试用期收反馈,首交后再来一到两轮微调整,这个迭代周期一开始就写进排期。

两个常见后续问题一并答了。微调后的模型权重导不出来,只能通过 Vertex AI 的 API 调用,要完全控制权重的得转开源方案。模型变差了比想象中常见,排查顺序是先查数据质量和格式一致性,再减训练轮数重训,收尾补数据多样性。重训节奏看业务变化速度,规则和产品信息常动的每季度评估一次,稳定场景半年到一年。

再放一个新选项在雷达上,偏好调优。传统微调告诉模型正确答案是什么,偏好调优告诉模型哪个更好,训练数据是成对的,同一个输入给两个输出,标注优劣。客户对「好」的定义很主观、写不出规则的时候,比如品牌故事的好坏,让客户直接比较两个版本,比逼他写一份风格规范现实得多。实操上让基础模型对同一输入生成五到十个输出,人工挑出最好的和一般的,组成偏好对。

收尾把七条实战经验压成清单,一百条左右的小数据集起步快速迭代,困难样本优先进训练集,训练数据贴近生产环境的真实提问,上线后持续收集反馈定期更新数据,每次微调保存配置和数据做好版本管理,训练时没用受控生成推理时就别加容易掉点,多模态微调先从纯文本验证流程再逐步加数据。

第一步从今天就能开始,把基线测试那一百条样本的表格建起来。

微调账单与验收几何插画,计算器吐出账单长条,四行验收清单全挂对勾,末端火箭示意上线