一个会顺着你的回答往下追的面试官。带着你的简历和目标岗位开场,追到你讲清楚或讲不下去为止;面完给你一张每条依据都能回到原话的评分卡。开源,数据留在本机。
2026-09-20 一场真实模拟面试的节选,公司与候选人已匿名;面试官的话与理由是原文。
它怎么问
面试官每一步都会写下为什么这么问。下面三段来自同一场面试:你刚说了什么,它接着问什么,以及它当时的理由。这些理由面完会出现在你的报告里。
你说
最难的是摘要把用户的约束吃掉。用户前面说过“只看中文资料”,几轮后助手开始推英文论文。我先看最后一轮发给模型的完整上下文,确认那句约束不在里面;再往回找它在哪一次摘要重写时消失的,定位到滚动摘要层。修法是把约束单独抽成结构化字段,不走摘要。
它接着问
你把约束从摘要里摘出来单独存,那「平均 prompt 长度降低约 50%」这个数是怎么算出来的——分子分母各是什么,跟什么基线比的,跑了多少会话?
它为什么这么问
约束丢失的排查已讲实,转到数字口径:50% 是简历最显眼的量化结论。
你说
分子是分层压缩下每轮发给模型的 prompt_tokens 均值,分母是全量历史直接拼接的均值,都用接口返回的 usage 统计。二十多个测试会话,每个十到二十轮。不足是只看了长度,没有对照任务成功率。
它接着问
你主动说了「没有对照任务成功率」,这点挺实在。那换个方向:离线评测集改完提示词后成功率涨了 3 个点,你要先做什么,才能判断这 3 个点是真涨还是噪声?
它为什么这么问
长度指标口径已答清(缺成功率对照),转入评估方法,看噪声与判据意识。
你说
这块我直说:当时没做严格的评测集。如果现在做,我会写一组带约束的脚本会话,在第二十轮用代码断言回答有没有违反第一轮的约束,不需要人工标注;再用同一配置跑两遍拿噪声底线。
它接着问
代码断言替代人工标注、同配置跑两遍拿噪声底线,这两个动作都对。接着往下:如果跑两遍的差就有 5 个点,那你这个 3 个点的结论要怎么处理——评测集规模、比较方式你会怎么改?
它为什么这么问
追噪声底线这一步的判据:差值 5 点时怎么改规模与比较方式,看是否到判据层。
面完你拿到什么
报告先说失守在哪、练什么,再说站得住的,再核对简历上的说法经不经得起问。评分由独立于面试官的另一个 Agent 完成,它能查简历原文核对数字,引用必须逐字。
面试总分
65/ 100
总体评价
对 Study Assistant 的记忆分层与约束丢失链路讲得完整,排查顺序和修法都站得住;但在评测的样本量口径、配对判据和 judge 校准上失守,简历里的量化指标也缺样本与对照支撑。
失守在哪、练什么
练:抽 20 条带约束的多轮会话跑「约束是否被遵守」判定,把 token 降幅和约束遵守率画成同一条曲线
练:按成功率的二项分布反推:给定当前 p 与 95% 置信区间宽度目标,算出需要多少题、每题几次重复
练:拿一批已有标注的样本,让 judge 与人工逐条对齐打分,统计一致率并据此定出裁判校准的最小流程
简历上的说法经不经得起问
问清「50%」的分子分母是什么、基线怎么测的、跑了几次——档案显示量化结论常缺样本与对照。
分母为全量历史均值、分子为分层压缩均值,两套配置分别测而非同批会话对照,与这段记录一致。
同一场的真实报告节选
0.10 vs 0.53
评分卡里每场找不到原话的引用条数:本系统 vs 同一模型只用一段提示词
30 场对照,候选人由模型模拟
78.6% → 97.0%
不支持结构化输出的模型:一次通过率 → 降级后可用产出率
1636 次真实调用
≈ 6 美分
一场约 16 回合面试的模型费用
DeepSeek,含备课与逐段评分
闭环
投递给面试提供岗位描述,面试给复盘提供回答,复盘给画像提供证据,画像再决定下一场模拟面试的重点。每一步都在为下一步积累。
边界
正式使用时,数据库、简历文件与浏览器状态都在你自己的设备上,不进入任何中央数据库。
Boss 登录、扫码、验证码始终由你本人完成;系统只读取已有记录,不自动投递,也不发消息。