这次一面的问题主要分为五块: 1. 自我介绍:回答得比较散,没有把实习、RAG / Agent 项目和数仓项目串成一条清晰主线。之后会固定为“身份与方向 → 数据处理与质量校验实践 → 两个代表项目 → 求职方向”的结构。 2. SQL:题目给出 user_id 和 online_date,要求统计一年内连续登录 7 天的用户总数,现场没有写出来。这里既暴露了窗口函数与连续区间题型不熟,也暴露了临场拆题能力不足。 3. 项目深挖:先讲 RAG 项目,再讲电商数仓项目。RAG 部分提到了数据来源、文档切分和检索,但没有把存储、召回、验证与结果串完整;数仓部分只抛了几个关键词。后续又被追问项目难点、材料来源、实现方式,以及 Spark Shuffle 的完整过程,回答的细度都不够。 4. AI 工程与工具:被问到是否写过 Skill、Skill 与 MCP 的区别、使用过哪些 Agent,以及 Claude 和 Codex 的差异。也聊到了团队可用模型和大模型在实际业务中的使用情况。 5. 职业与业务:被问是否打算读研;反问环节了解到岗位会接触广告投放、推荐和数据供给,也确认了大模型已经在业务中深度使用并产生实际产出。 面试官给的建议很直接:专业知识要掌握得更细,自己做过的项目更要经得起连续追问;除了“做过什么”,还要讲清楚因为兴趣主动学了什么、为什么做,以及最终验证出了什么。 复盘下来,这次最大的问题不是完全没做过,而是有经历却讲不成结构,同时 SQL、Spark 和数仓基础也不够扎实。接下来会固定自我介绍和行为面试回答,持续练 SQL 与 Python / Java 代码和调试,彻底梳理 RAG 与数仓项目,再做追问式模拟面试并录音复盘。
Interview notes