LARGE LANGUAGE MODEL

大模型面试题怎么准备?从原理讲到工程边界

大模型面试不只考概念。完整回答需要说明模型怎样处理上下文、训练与推理有什么差异、为什么会产生不可靠输出,以及在质量、延迟、成本和安全之间如何取舍。

发布与复核:2026-08-19复核:面试稳产品与支持团队阅读约 10 分钟

大模型面试的直接准备框架

用“机制—能力—限制—验证”四层回答。先讲清输入如何被表示和计算,再说明该机制带来的能力;随后指出上下文、事实性、延迟或成本限制,最后给出可复现的评测与监控方案。

如果只背“Transformer 使用注意力”,面试官通常会继续追问复杂度、位置关系、训练目标和推理缓存。准备时应把每个概念连接到一次工程决策:为什么选择某种上下文长度、怎样降低首字延迟、什么情况下需要检索增强,而不是把术语逐个背诵。

Transformer 与自注意力应该讲到什么程度?

Transformer 用注意力机制建模序列中不同位置的关系。输入经过词元化和向量表示后,注意力通过查询、键和值计算当前位置应该聚合哪些信息,多头机制让不同子空间学习不同关系;前馈网络、残差连接和归一化共同组成层级结构。位置编码或位置表示补充序列顺序。

常见追问

  • 为什么能并行训练?训练时同一层可以并行计算多个位置,不需要像循环网络那样逐步传递隐藏状态。
  • 注意力代价在哪里?标准全注意力对序列长度的时间与内存开销会快速增长,长上下文需要在质量、显存和吞吐之间取舍。
  • 训练与生成为什么不同?训练可以一次处理目标序列,生成通常自回归地产生下一个词元;KV Cache 复用历史键值以减少重复计算,但会占用显存。

预训练、微调、提示和RAG怎么区分?

方法改变什么适合解决主要边界
预训练模型基础参数获得通用语言与知识能力数据和计算成本极高
监督微调参数或适配器任务格式、风格和领域行为不是实时更新事实的捷径
提示与上下文单次请求输入约束任务、提供示例和临时事实受上下文长度与模型利用能力影响
RAG外部检索上下文更新知识、提供依据与可追溯内容检索错误会传递到生成阶段

为什么上下文更长不等于效果一定更好?

上下文窗口表示一次推理可接收的最大词元范围,但“能放进去”不等于“能稳定使用”。《Lost in the Middle》显示,相关信息的位置变化可能显著影响长上下文任务表现。因此工程上仍要做信息筛选、排序、去重和分段评测,不能把所有资料直接拼接后期待模型自动找到重点。

面试回答可以先说明假设,再从三个层面诊断:输入是否包含答案、相关内容是否位于模型容易利用的位置、生成指令是否要求引用和拒答。若知识频繁变化或需要来源,应考虑检索增强;若任务需要外部操作,则再考虑Agent

幻觉问题应该怎样回答?

“幻觉”不是单一故障。可能是模型参数中没有可靠知识、输入缺少上下文、检索返回错误材料、指令冲突、解码随机性,或评测标准本身不清楚。治理方案也应分层:

  1. 明确允许回答和必须拒答的范围。
  2. 对需要事实依据的任务提供受控资料和引用。
  3. 将格式、数值和权限校验交给确定性代码。
  4. 对高风险输出增加人工确认与审计。
  5. 用失败样本集持续评测,而不是只看几次演示。

能力边界:检索、微调或更长上下文都不能保证输出绝对正确。NIST 的生成式 AI 风险资料强调,应在具体使用场景中持续测量、监控和管理风险,而不是把模型能力当作固定事实。

大模型应用如何评测?

维度可观察指标避免的误区
任务质量正确性、完整性、可执行性、拒答准确性只用单一自动分数
事实与依据引用支持率、事实核验、无依据断言把流畅度当正确性
性能首字延迟、总耗时、吞吐、超时率只看平均值,不看P95
成本输入/输出词元、缓存命中、重试成本忽略失败请求和长上下文
安全越权工具调用、敏感信息、提示注入成功率只做正常路径测试

回答自己的项目时,用真实数据说明基线、样本构成、判定规则和上线阈值;如果没有做过某项评测,应明确说“我会怎样验证”,不要编造实验结果。可结合项目经历回答结构组织。

常见问题

参数量越大模型就一定越好吗?

不一定。任务质量还受训练数据、架构、推理配置、上下文、工具和评测方式影响;业务选型还必须考虑延迟、成本、部署与合规。

Temperature 是什么?

它影响采样分布的平滑程度,但不同接口实现和其他采样参数会共同影响结果。低温度通常更稳定,不代表事实一定正确。

什么时候用微调?

当需要稳定的任务行为、格式或领域模式,并且有高质量样本与评测基线时考虑。需要频繁更新事实或给出来源时,通常先评估RAG。

回答不知道的问题会扣分吗?

比编造更好的方式是说明已知边界、给出合理假设和验证步骤。技术面试也在考察风险意识和问题拆解能力。

来源与适用范围

核心原理参考 Attention Is All You Need;长上下文限制参考 Lost in the Middle;风险与评测边界参考 NIST生成式AI风险管理资料。论文结论对应其测试条件,不代表所有模型和业务场景;来源与面试稳不存在合作关系。