Réglage et optimisation des LLM
| Cas d'usage | Activités déjà équipées en IA mais aux réponses imprécises |
|---|---|
| Clients types | Équipes qui ont déjà essuyé les plâtres et savent que l'IA n'est pas magique |
| Délai | 2 à 6 semaines |
先说结论
大部分 »模型不行 »的场景,实际不是模型的问题。我见过太多团队急着换更大的模型,
而真正的原因是:检索回来的片段被表格切碎了、提示词没告诉它不确定就说不知道、
新旧两版文档混在一起。
具体做什么
提示词工程
不是写几句 »你是一个专家 »。是定义输出结构、拒答边界、证据引用格式,
再做多轮对比测试挑最优版本。
RAG 检索调优
切片粒度、召回策略、重排序、版本冲突处理。这是提升幅度最大的一环,
通常能把命中率从五成拉到九成。
微调(必要时)
提示词和检索做到头还差一口气时才做。微调贵、难维护,我不推荐一上来就微调。
效果评测(这是核心)
抽 50~100 条真实业务问题,人工标注标准答案,跑四个指标:
事实准确率、引用命中率、应拒答率、人工复核量。
指标必须可复算——换个人来跑,结果一样。
交付物
- 一份体检报告:现在错在哪、错多少、为什么
- 调优后的提示词与检索配置,带版本记录
- 评测集与自动化评测脚本(你可以自己复跑)
- 每月指标报告
不做什么
- 不承诺 100% 准确,承诺这个的人不可信
- 不做 »一次调优永久有效 »的买卖,知识会变,模型会退化