Interview · 30-min Sprint · 2026-07-17 下午

李政雄面试 · 30 分钟速版

候选人:上海交大机械硕士在读(2027.3 毕业),LingoAce AI 应用开发实习 3 个月。只有半小时,砍掉所有低区分度问题,留 7 题 —— 每题都在测"简历是他做的,还是他看的"。跟着时间条走,超时就跳下一题。

7 题
核心问题
30 min
总时长
3 题
定生死的鉴别题
3 条
硬性信息必确认

时间表

时间环节题号
0–3 min自我介绍:只讲 LingoAce 实习,限 2 分钟
3–15 minLingoAce 深挖(全场重点)Q1 / Q2 / Q3
15–20 min项目鉴别题 + 安全快问Q4 / Q5
20–26 min基础快问(后端一题 + AI 一题)Q6 / Q7
26–30 min硬性信息三连 + 候选人反问一个

开场就说"今天时间紧,我会打断你,不是不礼貌"。深挖时一旦确认"真做过"就推进,不恋战。

3–15 min · LingoAce 实习(Q1–Q3)

3 个月实习写了 4 大块产出,这 12 分钟测同一件事:他是设计者、执行者,还是旁观者。三题各 4 分钟。

简历原文 · 实习经历(项目背景)

"LingoAce · AI 应用开发工程师 · 2026.05–2026.07。参与儿童英语 AI Tutor 大模型工程化改造……推进 ASR 前置识别增强、统一 Prompt 协议、模型微调与分层评测闭环建设"

Q1 · 微调选型 · 4 min

为什么 ASR 选 1.7B、Tutor 选 14B?Full SFT 还是 LoRA,为什么?

简历原文 · 实习经历 3

"ASR 侧基于 10628 条儿童英语课堂音频与人工转写数据,完成文本清洗、上下文热词生成与 Qwen3-ASR-1.7B 微调,在 1,063 条测试集上 WER 降至 15.93%、目标词命中率达 97.64%;回复侧……完成 Qwen3-14B Tutor 回复模型 Full SFT"

答案要点
  • ASR 是窄任务 + 延迟敏感(课堂实时转写),小模型微调后够用且快、部署便宜;Tutor 回复要教学推理和低龄语言把控,任务宽,需要 14B 这档能力。
  • Full SFT vs LoRA:万级样本 + 要大幅改变输出行为(统一 Schema 格式),Full SFT 说得通。但他应该知道 LoRA 是什么、为什么没选(省显存、可插拔、但行为改变幅度有限)。
  • 必追一句:WER 15.93% 的 baseline 是多少?微调前后差多少?
加分

baseline 张口就来;知道 10628 条数据怎么清洗的。

扣分

说不出 Full SFT 和 LoRA 的区别;指标很熟但 baseline 一问三不知 —— 大概率只是看过报告。

Q2 · 延迟优化 · 4 min

800ms 降到 300ms —— vLLM 里具体是什么在起作用?

简历原文 · 实习经历 3

"通过 vLLM + Spring AI 接入 Java 后端真实链路,测试链路单次回复延迟由约 800ms 降至 300ms 量级"

答案要点
  • 两个关键词必中其一:PagedAttention(KV cache 按页管理,显存利用率高)、continuous batching(请求随到随插,不等整批)。
  • 加分项:prefix caching(系统 Prompt 部分复用)、流式输出先降"首字延迟"、量化。
  • 能分清"单次回复总延迟"和"首 token 延迟"是真懂;能画出 Java 后端 → Spring AI → vLLM 的调用路径更好。
加分

主动说 500ms 的下降里模型变小(14B 换更早的大模型 API)占了多少、推理框架占了多少。

扣分

只答"vLLM 就是快"—— 说明部署不是他做的。

Q3 · 评测口径 · 4 min

AI Judge 和人工 95.5% 一致率,是怎么算出来的?

简历原文 · 实习经历 4

"覆盖 1200+ 条 Tutor 回复样本,引入 GPT-5.5 从教学动作选择、执行质量、情感支持和低龄语言适配四维评分,并自动输出低分归因;抽样 200 条人工复核,AI Judge 与人工判断一致率达 95.5%……badcase 占比由 14.2% 降至 3.8%"

答案要点
  • 套路:人工先标 200 条金标集,拿 Judge 的判断和人工比,不一致的回头改 Judge 的评分说明,迭代到达标。
  • 口径必须说得清:四个打分角度各自算,还是"低于 3 分"二值化后算整体?说不清口径 = 数字不是他算的
  • 加分:主动提 Judge 的坑(偏长回复、偏自家风格),所以才要人工抽检兜底。
加分

能举一个 Judge 和人工不一致的具体案例、后来怎么改的。

扣分

四个打分角度背得出,但任何一个的评分标准都说不出原文。

15–20 min · 项目鉴别 + 安全快问(Q4–Q5)

对应项目经历"智慧社区独居老人心理陪伴智能体"(2025.12–2026.02,开发人员)—— 他自己从头搭的东西,设计决策应该全部答得上来。

Q4 · 全场最佳鉴别题 · 3 min

Top3 Recall 96.5%、MRR 0.89 —— 测试集怎么构造的?多大规模?

简历原文 · 项目经历 2

"采用父子 Chunk 分层切分,实现'子块精准召回、父块补全上下文';结合 BM25、Chroma 向量检索和精排模型构建混合检索链,Top3 Recall 达 96.5%,MRR 达 0.89"

答案要点
  • 标准做法:从资料库构造 QA 对(人工写或 LLM 生成 + 人工校验),每个问题标注 golden chunk;Recall@3 = 前 3 条召回含 golden 的比例;MRR = golden 排名倒数的平均。
  • 必须能报出规模(几十条还是几百条)和谁标的。几十条自己标的也 OK,诚实说出来反而加分。
  • 顺带听一句父子 Chunk 的人话解释:小块拿来精准匹配,命中后把父块(完整段落)塞给模型。
加分

知道 96.5% 在小测试集上有水分(题和资料同源,偏简单),主动说出来。

扣分

说不出测试集从哪来 —— 这两个数字不采信,简历其他数字也要打折。

Q5 · 安全直觉(快问) · 2 min

SafetyAgent:硬规则和模型判断冲突时听谁的?

简历原文 · 项目经历 4

"设计 SafetyAgent 双重安全审查机制,结合风险硬规则、模型结构化评估和历史上下文判断风险等级……未通过时触发修改与重新审核,通过后调用 MCP 工具生成风险报告、社区个案和预警记录"

答案要点
  • 正确答案只有一个方向:就高不就低。任何一路判定高风险就按高风险处理 —— 对象是独居老人的心理危机,宁可误报,不可漏报。
  • 硬规则一票否决;模型判断只能把风险等级往上提,不能往下降
加分

不假思索答对,还能讲误报的代价和怎么用历史上下文降误报。

扣分

答"看模型置信度"或犹豫 —— 安全直觉缺失。

20–26 min · 基础快问(Q6–Q7)

简历写"精通 Java"。后端和 AI 各留一题,都是熟练者的送分题。

Q6 · 后端 · 3 min

ThreadPoolExecutor:任务进来的执行顺序?拒绝策略有哪些?

简历原文 · 专业技能 1

"精通 Java,深入理解集合、JUC、JVM 原理……熟悉 Kafka、MySQL、Redis 的核心机制与性能调优"

标准答案
  • 执行顺序(必答对):先核心线程 → 满了进队列 → 队列满了开临时线程到 max → 还不行才拒绝
  • 四种拒绝策略:Abort(抛异常,默认)、CallerRuns(调用方自己跑,天然限流)、Discard(静默丢)、DiscardOldest(丢队头)。
  • 加分:知道无界队列会让 max 参数失效、可能内存打爆,所以生产上要设界。

时间富余可追一句 Kafka:什么配置下会丢消息?(期望听到 acks / 副本 / 先提交 offset 后处理 中至少两点。)

Q7 · AI 基础 · 3 min

RAG 的幻觉从哪来?怎么压?

简历原文 · 专业技能 3

"掌握文档解析、分块、Embedding、向量检索与上下文拼接全流程,通过混合检索与 Top-K 策略优化召回、降低幻觉"

标准答案
  • 来源至少三个:检索不中(召回不相关的块,模型硬编);切块切碎了(上下文断掉,模型脑补);模型不看资料(用参数知识抢答)。
  • 压法对应:混合检索 + 重排;父子块 / 重叠切块;Prompt 强制"只依据资料、没有就说不知道";答案带引用来源。
  • 加分:说出"检索的锅占大头,先修检索再怪模型"这个判断。

26–30 min · 硬性信息三连

简历原文 · 基本信息 / 教育背景

"在读·互联网·AI 应用开发工程师;上海交通大学 机械 硕士 2024.09–2027.03;现居城市:上海"

事项及格线备注
每周到岗≥ 4 天研二课程压力要问实话
可实习时长≥ 6 个月2026.07 起算,问导师是否放人
转正意愿明确意向2027.03 毕业,正好卡校招转正窗口

这三条缺一条,技术面再好也要在反馈里标黄。最后留 1 分钟给候选人反问。

面后 5 分钟评分

维度权重看哪几题5 分长什么样
LLM 工程实战45%Q1–Q4数字口径全说得清,能讲取舍和翻车案例
基础功底25%Q6–Q7两题全中,主动提生产注意事项
直觉与表达15%Q5 + 全程安全题秒答对,回答有结构
匹配度15%收尾三连到岗 / 时长 / 转正全达标

一票规则:Q1、Q3、Q4 三题里有两题答不出数字口径 → 简历所有指标按团队产出处理,个人评价降半档。3.5 以上推进,3.0–3.5 建议加面,3.0 以下婉拒。