评估、安全与面试综合篇
大约 1 分钟

评估、安全与面试综合篇
大模型如何评估?幻觉怎么防?安全护栏怎么设计?面试如何组合落地?
本篇是大模型100讲的收尾篇章,覆盖评估体系(Benchmark、BLEU/ROUGE、人工评估)、幻觉问题与对策、安全风险与内容审核、日志监控与可观测性,以及 RAG/微调/Agent 组合落地和从零设计大模型应用平台的面试综合题。
本篇内容
| 序号 | 文章 | 状态 |
|---|---|---|
| 1 | 大模型如何评估?常见 Benchmark 有哪些? | 持续更新中 |
| 2 | 生成质量如何评价?BLEU、ROUGE、人工评估怎么选? | 持续更新中 |
| 3 | 幻觉是什么?为什么大模型会胡说? | 持续更新中 |
| 4 | 如何减少大模型幻觉? | 持续更新中 |
| 5 | 大模型安全问题有哪些? | 持续更新中 |
| 6 | 内容审核和安全护栏如何设计? | 持续更新中 |
| 7 | 大模型应用如何做日志、监控和可观测性? | 持续更新中 |
| 8 | 面试高频:RAG、微调、Agent 如何组合落地? | 持续更新中 |
| 9 | 面试高频:从零设计一个大模型应用平台 | 持续更新中 |
| 10 | 大模型学习路线总结:从基础到 Agent 工程落地 | 持续更新中 |
