候选人:上海交大机械硕士在读(2027.3 毕业),LingoAce AI 应用开发实习 3 个月。只有半小时,砍掉所有低区分度问题,留 7 题 —— 每题都在测"简历是他做的,还是他看的"。跟着时间条走,超时就跳下一题。
| 时间 | 环节 | 题号 |
|---|---|---|
| 0–3 min | 自我介绍:只讲 LingoAce 实习,限 2 分钟 | — |
| 3–15 min | LingoAce 深挖(全场重点) | Q1 / Q2 / Q3 |
| 15–20 min | 项目鉴别题 + 安全快问 | Q4 / Q5 |
| 20–26 min | 基础快问(后端一题 + AI 一题) | Q6 / Q7 |
| 26–30 min | 硬性信息三连 + 候选人反问一个 | — |
开场就说"今天时间紧,我会打断你,不是不礼貌"。深挖时一旦确认"真做过"就推进,不恋战。
3 个月实习写了 4 大块产出,这 12 分钟测同一件事:他是设计者、执行者,还是旁观者。三题各 4 分钟。
"LingoAce · AI 应用开发工程师 · 2026.05–2026.07。参与儿童英语 AI Tutor 大模型工程化改造……推进 ASR 前置识别增强、统一 Prompt 协议、模型微调与分层评测闭环建设"
"ASR 侧基于 10628 条儿童英语课堂音频与人工转写数据,完成文本清洗、上下文热词生成与 Qwen3-ASR-1.7B 微调,在 1,063 条测试集上 WER 降至 15.93%、目标词命中率达 97.64%;回复侧……完成 Qwen3-14B Tutor 回复模型 Full SFT"
baseline 张口就来;知道 10628 条数据怎么清洗的。
说不出 Full SFT 和 LoRA 的区别;指标很熟但 baseline 一问三不知 —— 大概率只是看过报告。
"通过 vLLM + Spring AI 接入 Java 后端真实链路,测试链路单次回复延迟由约 800ms 降至 300ms 量级"
主动说 500ms 的下降里模型变小(14B 换更早的大模型 API)占了多少、推理框架占了多少。
只答"vLLM 就是快"—— 说明部署不是他做的。
"覆盖 1200+ 条 Tutor 回复样本,引入 GPT-5.5 从教学动作选择、执行质量、情感支持和低龄语言适配四维评分,并自动输出低分归因;抽样 200 条人工复核,AI Judge 与人工判断一致率达 95.5%……badcase 占比由 14.2% 降至 3.8%"
能举一个 Judge 和人工不一致的具体案例、后来怎么改的。
四个打分角度背得出,但任何一个的评分标准都说不出原文。
对应项目经历"智慧社区独居老人心理陪伴智能体"(2025.12–2026.02,开发人员)—— 他自己从头搭的东西,设计决策应该全部答得上来。
"采用父子 Chunk 分层切分,实现'子块精准召回、父块补全上下文';结合 BM25、Chroma 向量检索和精排模型构建混合检索链,Top3 Recall 达 96.5%,MRR 达 0.89"
知道 96.5% 在小测试集上有水分(题和资料同源,偏简单),主动说出来。
说不出测试集从哪来 —— 这两个数字不采信,简历其他数字也要打折。
"设计 SafetyAgent 双重安全审查机制,结合风险硬规则、模型结构化评估和历史上下文判断风险等级……未通过时触发修改与重新审核,通过后调用 MCP 工具生成风险报告、社区个案和预警记录"
不假思索答对,还能讲误报的代价和怎么用历史上下文降误报。
答"看模型置信度"或犹豫 —— 安全直觉缺失。
简历写"精通 Java"。后端和 AI 各留一题,都是熟练者的送分题。
"精通 Java,深入理解集合、JUC、JVM 原理……熟悉 Kafka、MySQL、Redis 的核心机制与性能调优"
时间富余可追一句 Kafka:什么配置下会丢消息?(期望听到 acks / 副本 / 先提交 offset 后处理 中至少两点。)
"掌握文档解析、分块、Embedding、向量检索与上下文拼接全流程,通过混合检索与 Top-K 策略优化召回、降低幻觉"
"在读·互联网·AI 应用开发工程师;上海交通大学 机械 硕士 2024.09–2027.03;现居城市:上海"
| 事项 | 及格线 | 备注 |
|---|---|---|
| 每周到岗 | ≥ 4 天 | 研二课程压力要问实话 |
| 可实习时长 | ≥ 6 个月 | 2026.07 起算,问导师是否放人 |
| 转正意愿 | 明确意向 | 2027.03 毕业,正好卡校招转正窗口 |
这三条缺一条,技术面再好也要在反馈里标黄。最后留 1 分钟给候选人反问。
| 维度 | 权重 | 看哪几题 | 5 分长什么样 |
|---|---|---|---|
| LLM 工程实战 | 45% | Q1–Q4 | 数字口径全说得清,能讲取舍和翻车案例 |
| 基础功底 | 25% | Q6–Q7 | 两题全中,主动提生产注意事项 |
| 直觉与表达 | 15% | Q5 + 全程 | 安全题秒答对,回答有结构 |
| 匹配度 | 15% | 收尾三连 | 到岗 / 时长 / 转正全达标 |
一票规则:Q1、Q3、Q4 三题里有两题答不出数字口径 → 简历所有指标按团队产出处理,个人评价降半档。3.5 以上推进,3.0–3.5 建议加面,3.0 以下婉拒。