LARGE LANGUAGE MODEL
大模型面试题怎么准备?从原理讲到工程边界
大模型面试不只考概念。完整回答需要说明模型怎样处理上下文、训练与推理有什么差异、为什么会产生不可靠输出,以及在质量、延迟、成本和安全之间如何取舍。
大模型面试的直接准备框架
用“机制—能力—限制—验证”四层回答。先讲清输入如何被表示和计算,再说明该机制带来的能力;随后指出上下文、事实性、延迟或成本限制,最后给出可复现的评测与监控方案。
如果只背“Transformer 使用注意力”,面试官通常会继续追问复杂度、位置关系、训练目标和推理缓存。准备时应把每个概念连接到一次工程决策:为什么选择某种上下文长度、怎样降低首字延迟、什么情况下需要检索增强,而不是把术语逐个背诵。
Transformer 与自注意力应该讲到什么程度?
Transformer 用注意力机制建模序列中不同位置的关系。输入经过词元化和向量表示后,注意力通过查询、键和值计算当前位置应该聚合哪些信息,多头机制让不同子空间学习不同关系;前馈网络、残差连接和归一化共同组成层级结构。位置编码或位置表示补充序列顺序。
常见追问
- 为什么能并行训练?训练时同一层可以并行计算多个位置,不需要像循环网络那样逐步传递隐藏状态。
- 注意力代价在哪里?标准全注意力对序列长度的时间与内存开销会快速增长,长上下文需要在质量、显存和吞吐之间取舍。
- 训练与生成为什么不同?训练可以一次处理目标序列,生成通常自回归地产生下一个词元;KV Cache 复用历史键值以减少重复计算,但会占用显存。
预训练、微调、提示和RAG怎么区分?
| 方法 | 改变什么 | 适合解决 | 主要边界 |
|---|---|---|---|
| 预训练 | 模型基础参数 | 获得通用语言与知识能力 | 数据和计算成本极高 |
| 监督微调 | 参数或适配器 | 任务格式、风格和领域行为 | 不是实时更新事实的捷径 |
| 提示与上下文 | 单次请求输入 | 约束任务、提供示例和临时事实 | 受上下文长度与模型利用能力影响 |
| RAG | 外部检索上下文 | 更新知识、提供依据与可追溯内容 | 检索错误会传递到生成阶段 |
为什么上下文更长不等于效果一定更好?
上下文窗口表示一次推理可接收的最大词元范围,但“能放进去”不等于“能稳定使用”。《Lost in the Middle》显示,相关信息的位置变化可能显著影响长上下文任务表现。因此工程上仍要做信息筛选、排序、去重和分段评测,不能把所有资料直接拼接后期待模型自动找到重点。
面试回答可以先说明假设,再从三个层面诊断:输入是否包含答案、相关内容是否位于模型容易利用的位置、生成指令是否要求引用和拒答。若知识频繁变化或需要来源,应考虑检索增强;若任务需要外部操作,则再考虑Agent。
幻觉问题应该怎样回答?
“幻觉”不是单一故障。可能是模型参数中没有可靠知识、输入缺少上下文、检索返回错误材料、指令冲突、解码随机性,或评测标准本身不清楚。治理方案也应分层:
- 明确允许回答和必须拒答的范围。
- 对需要事实依据的任务提供受控资料和引用。
- 将格式、数值和权限校验交给确定性代码。
- 对高风险输出增加人工确认与审计。
- 用失败样本集持续评测,而不是只看几次演示。
能力边界:检索、微调或更长上下文都不能保证输出绝对正确。NIST 的生成式 AI 风险资料强调,应在具体使用场景中持续测量、监控和管理风险,而不是把模型能力当作固定事实。
大模型应用如何评测?
| 维度 | 可观察指标 | 避免的误区 |
|---|---|---|
| 任务质量 | 正确性、完整性、可执行性、拒答准确性 | 只用单一自动分数 |
| 事实与依据 | 引用支持率、事实核验、无依据断言 | 把流畅度当正确性 |
| 性能 | 首字延迟、总耗时、吞吐、超时率 | 只看平均值,不看P95 |
| 成本 | 输入/输出词元、缓存命中、重试成本 | 忽略失败请求和长上下文 |
| 安全 | 越权工具调用、敏感信息、提示注入成功率 | 只做正常路径测试 |
回答自己的项目时,用真实数据说明基线、样本构成、判定规则和上线阈值;如果没有做过某项评测,应明确说“我会怎样验证”,不要编造实验结果。可结合项目经历回答结构组织。
常见问题
参数量越大模型就一定越好吗?
不一定。任务质量还受训练数据、架构、推理配置、上下文、工具和评测方式影响;业务选型还必须考虑延迟、成本、部署与合规。
Temperature 是什么?
它影响采样分布的平滑程度,但不同接口实现和其他采样参数会共同影响结果。低温度通常更稳定,不代表事实一定正确。
什么时候用微调?
当需要稳定的任务行为、格式或领域模式,并且有高质量样本与评测基线时考虑。需要频繁更新事实或给出来源时,通常先评估RAG。
回答不知道的问题会扣分吗?
比编造更好的方式是说明已知边界、给出合理假设和验证步骤。技术面试也在考察风险意识和问题拆解能力。
来源与适用范围
核心原理参考 Attention Is All You Need;长上下文限制参考 Lost in the Middle;风险与评测边界参考 NIST生成式AI风险管理资料。论文结论对应其测试条件,不代表所有模型和业务场景;来源与面试稳不存在合作关系。