大模型面试题
2026/6/17大约 4 分钟大模型面试面试题LLM
大模型面试题
大模型面试高频问题精选,共 47 篇文章,覆盖基础概念、Transformer 架构、训练流程和推理优化四大方向。
每篇文章围绕一个具体问题展开,讲清楚"是什么、为什么、怎么做",适合准备 AI 岗位面试的候选人。
合集文章导航
基础概念篇
- 大模型到底是什么? - 和传统 NLP 模型的区别
- 为什么主流大模型采用 Decoder-only 架构? - 架构选择的原因
- Token 是什么?分词算法有什么区别? - BPE、WordPiece、SentencePiece
- Token 数量如何计算和控制? - 上下文长度与成本的关系
- Embedding 在大模型中起什么作用? - Token Embedding 和 Position Embedding
- Word2Vec 到 BERT 有怎样的改进? - 静态到动态词向量的演进
- Word2Vec 如何获取和评估词向量? - 相似度任务与类比推理
- chatGLM 和 GPT 在结构上有什么区别? - Prefix Decoder vs Decoder-only
- 什么是大模型的涌现能力? - 涌现现象的成因
- 什么是 ViT(Vision Transformer)? - Transformer 在视觉的应用
- ViLT 模型是如何将 Transformer 应用于图像识别的? - 视觉-语言统一架构
- LSTM 是如何解决梯度消失问题的? - 与 RNN 的对比
Transformer 架构篇
- Self-Attention 中 Q、K、V 分别是什么意思? - 为什么要除以根号 dk
- Self-Attention 中 K 和 Q 是用来做什么的? - 查询-键值机制的本质
- 注意力遮蔽(Attention Masking)的工作原理是什么? - Causal/Padding Mask
- Transformer 在计算 attention 时用点乘还是加法? - 缩放点积注意力的优势
- 为什么 Transformer 采用多头注意力机制? - 多子空间表达
- Multi-Head Attention、MQA 和 GQA 有什么区别? - KV Cache 开销优化
- 位置编码是什么?RoPE 为什么很常用? - 旋转位置编码原理
- LLaMA 中的旋转位置编码了解吗? - RoPE 的数学推导
- Transformer 的位置编码是怎样的? - 绝对/相对位置编码
- Transformer 中 FFN 层有什么作用? - SwiGLU 激活函数
- LayerNorm 和 RMSNorm 有什么区别? - 为什么大模型用 RMSNorm
- Transformer 为什么采用 Layer Normalization 而不是 Batch Norm? - 归一化方法对比
- Decoder 和 Encoder 阶段的多头自注意力有什么区别? - Cross-Attention 与 Masked Self-Attention
- Transformer 如何实现序列到序列的映射? - Encoder-Decoder 架构
- Transformer 中的残差连接可以缓解梯度消失吗? - 残差连接的原理
- Transformer 如何处理大型数据集? - 分布式训练与梯度累积
- Transformer 的性能瓶颈在哪? - 计算/显存/访存分析
- Transformer 哪个部分最占用显存? - KV Cache 显存开销
- Transformer 训练完成后如何评估性能? - 困惑度与下游任务
- Transformer 和 LLM 有哪些区别? - 架构与模型的关系
训练流程篇
- 大模型预训练目标是什么? - Next Token Prediction
- 预训练、SFT、偏好对齐分别解决什么问题? - 训练流程全景
- Transformer 模型训练中的梯度裁剪了解吗? - 防止梯度爆炸
- RLHF 和 DPO 有什么区别? - 偏好对齐方法对比
- RLHF 的完整训练流程是怎样的? - SFT 到 Reward Model 到 PPO
- ORPO 是什么?它如何将指令微调和偏好对齐合二为一? - 一步式对齐
- LoRA 和 QLoRA 是什么? - 参数高效微调
- LoRA 的数学原理是什么? - 低秩分解近似全量微调
- LoRA 的超参数应该怎么设置? - rank、alpha 的经验法则
推理优化篇
- 上下文窗口是什么? - 长上下文的局限
- KV Cache 是什么? - 自回归生成加速
- Temperature、Top-k、Top-p 分别控制什么? - 采样参数调优
- Temperature 和 Top_p 参数有什么作用? - 如何选择合适的值
- 大模型幻觉是什么? - 幻觉的成因与缓解
- MoE 架构是什么? - 专家混合结构
