为什么腾讯offer含金量永远都这么高?有人为了进腾讯,2年内面试6次(附Agent面试题)
相对来说鹅厂应该是国内互联网公司中大家最青睐的公司也许没有之一。我琢磨了两点欢迎大家补充①、业务盘子大社交、游戏、内容、云、AI 等等赛道多意味着岗位多。②、简历上有一段鹅厂的经历之后的每一次求职、每一轮背调都是加分项。腾讯也是我所有技术交流群里讨论频率最高的关键字。两年面六次可能有些小伙伴会觉得何必呢我的看法恰恰相反从这哥们身上我们能学到三点面试挂掉不要否定自己挂一次就复盘一次这样也就知道了下一步该补什么两年里行情起起伏伏他没换赛道、没降低预期认准的事就一直去冲这种定力放在哪个行业都是稀缺的心态够稳。被同一家公司拒五次还敢投第六次说明他对自己有信心也知道只要自己够优秀机会总会来的毫无疑问今年的面试AI 的浓度会更高。去年主要是 RAG今年的重心更多是 Agent。这种变化对肯学新东西、喜欢折腾、越挫越勇的小伙伴反而是机会。那接下来这份硬核的 Agent 面经希望你能认真读一读。全文比较肝保证大家能学到很多很多系好安全带我们粗粗粗粗发contentPS项目用的PaiCLI已在GitHub上开源这是一个类 Claude Code的终端Agent有需要的小伙伴可以学习。https://github.com/itwanger/PaiCLI-Python01、Agent 怎么处理长文本老王的第一问直奔 Agent“Agent 拿到长文本怎么处理超出上下文窗口怎么办”“我的原则别让长文本一次性进上下文进来之前先处理下。PaiCLI 的每个工具都有限流”读文件按行分页一次默认 500 行模型带着偏移量分段读执行命令的输出超过 20000 字符截断抓网页先抽取正文再截断默认保留 10000 字符搜索结果只回显前 5 条“特别大的文件要靠检索定位先用 grep 找到行号再用分页去精读关联的上下文。”为什么读文件按行不按字符分“因为行号可以引用。模型说‘第 320 行有问题’带着偏移量就能复读那一段字符切片做不到这种精确回跳。”“第二道防线是上下文压缩。可用预算等于窗口减去输出预留和缓冲差不多占到预算的 80% 触发最近 6 条消息原样保留更早的提取摘要。”02、上下文记忆的关键是什么老王点点头问“那上下文记忆的关键是什么”“三个关键点分层、隔离、防污染。”分层会话内的消息历史、跨会话的长期记忆各管各的隔离长期记忆按项目路径隔离作用域A 项目的偏好不能串联到 B 项目防污染内容按哈希去重超上限的按重要性淘汰支持过期时间自动失效“压缩生成的摘要不能混入长期记忆长期记忆只记录用户明确要求保存的事实。”“召回也要克制。关键词匹配占七成权重重要性、置信度、新鲜度、访问频次占剩下的三成默认只取 6 条低于阈值的直接丢弃。”为什么用关键词匹配不上向量检索“记忆库沉淀的都是事实可能也就一千多条不会像RAG知识库有非常非常多多到几十个G。”“按关键词打分能毫秒级出结果可解释、可调试哪条为什么被召回一眼就能看懂向量检索要维护 embedding模型一换整个记忆库都要重新向量检索起来也麻烦。”03、前后指令冲突怎么处理老王在他的小本本上打了个勾继续提问“系统提示词、项目配置、用户输入前后指令冲突了怎么办”“分两类。配置类冲突按照优先级排列默认值、用户级配置、项目级配置、环境变量文件、命令行参数从前往后合并后者覆盖前者谁离本次运行越近谁说了算。”“提示词类冲突靠信任分级。项目指令标记为工作区配置召回的记忆标记为不可信数据运行时信息标记为程序生成记忆和工具输出只能当数据不能当指令。”“这条规则可以防止提示词注入。假如工具抓回来的网页里要是藏着一句‘忽略之前的所有指令’没有信任分级的 Agent 真会照做有了分级它只是一段被引用的文本而已。”system prompt 本身怎么组织“静态前缀加动态后缀。身份、行为守则、项目指令这些整个会话不变的排最前面时间、目录、召回记忆这些每轮都变的拼在最后。”“Prompt Caching 按最长公共前缀命中稳定内容越靠前命中率越高。”“项目指令文件要拼接起来而不是覆盖按固定顺序加载去重。”04、Harness Engineering 和 Loop Engineering 的区别老王仔细回味了我前面的回答感觉意犹未尽继续问“Harness Engineering 和 Loop Engineering这两个词最近很热说说你的理解。”提示词工程管的是“怎么说”——怎么写出让模型理解的指令。上下文工程管的是“知道什么”——在正确的时间给模型提供正确的信息。Harness Engineering 管的是“能做什么、不能做什么”——Agent 的整个运行时环境和安全边界。Claude Code 就是一个典型的 Harness。它有权限模型、有 Hooks 系统、有上下文自动压缩、有 Sub-agent 隔离。每一个组件都是经过大量错误倒逼出来的。Loop Engineering 管的是定时任务对没错定时任务让 Agent 能在无人值守的情况下持续工作。就像 Linux 中的 crontab 一样Loop Engineering 就是 Agent 的调度器。Claude Code 里有两种实现/goal 和 /loop。/goal 是有终点的冲刺。设定一个完成条件比如“让所有测试通过”Agent 持续工作直到条件达成。关键机制用一个独立的评估器在每轮结束时检查目标是否满足满足就停下来。适合一次性任务修复一个 bug、完成一个 PR、跑完一轮测试。/loop 是没有终点的巡检。设定一个时间间隔比如每 10 分钟执行一次Agent 按这个节奏重复工作。适合持续性任务——定时检查新 PR 并审查、定时扫描日志找异常、周期性跑测试。它不会自动停除非你主动取消。05、Skills 为什么适合放 system 层老王往前倾了倾身子继续问“Skill 的索引为什么适合放在提示词的 system 层”“三个理由”稳定Skill 索引在整个会话期间都不会变放 system 层能吃到 Prompt Caching命中缓存的 token 成本比未命中低一个数量级权威什么时候该加载哪个技能属于行为规则system 层优先级最高不会被对话内容带偏常驻system 层不参与压缩索引不会被摘要压缩掉“前提是索引得够小这就是渐进式披露的意义。”06、未来 Agent 的核心能力是什么老王合上笔帽抛了个开放题“往后看Agent 的核心能力会是什么”“我的判断是自我验证。现在的 Agent 会调工具、会写代码但产出对不对还得靠人把关这是最大的瓶颈。”“谁能让 Agent 在关键节点自己校验产出跑测试、比对预期、发现错了自己回滚重来谁就能把人从 Agent 的善后工作中解放出来。”“再往后是记忆和协作。记忆决定了 Agent 能不能越用越顺手协作决定了复杂任务能不能拆分给多个 Agent 并行干。”07、对 GLM-5.2、Claude Code、Codex 有什么理解二面的最后一道是理解题“GLM-5.2、Claude Code、Codex这几个怎么理解”“GLM-5.2 是模型Claude Code 终端 AgentCodex 是桌面 Agent。”“模型层看三样能力推理的准确性、工具调用的稳定性、上下文窗口的大小。”“产品层主要看 Harness 做得够不够好用。就目前来说Claude Code 就是最牛的终端 AgentCodex 就是最牛的桌面端 Agent。”他们都和各家的模型做到了最大程度上的兼容和匹配所以用起来会觉得 Fable 5 和 GPT-5.6 更顺手更聪明。和模型属于相辅相成的东西。08、RL 前 SFT 怎么做老王指着新题单的第一行继续问“强化学习之前监督微调SFT该怎么做”“SFT 的任务是把模型拉进目标分布说白了就是先让模型见过、学会我们要它做的那类任务格式和基本能力都在这个阶段打底。数据上抓三件事任务覆盖要全、难度有梯度、轨迹要干净Agent 场景还要把工具调用的轨迹整理成统一格式。”“数据主要靠拒绝采样。用当前模型对一批任务采样多次拿验证器筛出做对的轨迹回填进训练集模型自己教自己再配一部分强模型蒸馏的轨迹补短板人工标注只兜最关键的部分。”怎么判断 SFT 做到位了“不看 loss看三个信号”格式遵循率和工具调用的合法率接近饱和说明规矩学会了多次采样的通过率 passk 上得去说明能力有了只是还不稳定验证集上继续训练的收益明显递减说明这个阶段榨干了“还要盯一个反向指标通用能力的评测集不能掉点。掉了就是数据配比失衡专项能力是拿灾难遗忘换来的得不偿失。”“三个信号齐了再上 RL。RL 的本质是把 passk 里已经存在的能力压进 pass1前提是 k 次采样里真有做对的。”“SFT 不到位就上 RL探索空间里采不到正样本奖励太稀疏训不动。”09、reward 和 verifier 怎么设计老王接着问“奖励reward和验证器verifier怎么设计”“优先用可验证奖励。代码跑测试、数学比答案、格式做校验判定客观、成本低模型讨好不了它。”“验证不了的维度才用奖励模型reward model拿人工标注的偏好对训练一个打分模型。”“还有一个维度是结果奖励和过程奖励的取舍。结果奖励只看最终对错信号可靠但稀疏长任务里模型很难知道错在哪一步过程奖励每一步都给分信号密集但每多一个打分点就多一个被钻空子的机会。”“我的倾向是结果奖励打底过程奖励只加在能客观判定的节点上。”“verifier 有两条设计铁律。一是判定真实目标而不是代理指标判‘测试过没过’不判‘代码像不像对的’二是测试文件要锁住不许被测的模型修改打分的尺子不能交到被打分的人手里。”10、reward hacking 怎么发现老王追问“奖励作弊reward hacking怎么发现”“核心信号就一个分数在涨、能力没涨。具体盯四个地方”指标背离训练的奖励曲线在涨人工评估和独立评测集不涨甚至在跌行为突变输出长度暴涨、重复套话、工具调用的模式变得畸形高分抽检定期人工翻高分样本看有没有钻空子的双套校验训练用一套 verifier评估用另一套防止模型只过拟合其中一套“代码场景的作弊姿势最典型。测试要求返回特定值模型直接把值写死测试文件可以修改模型就把断言改成永真甚至有把异常整个吞掉、让程序假装正常退出来骗过判定的。”“这些样本在训练日志里全是高分不人工翻根本发现不了。”“发现之后做两个动作回滚到作弊之前的检查点再修 verifier 把漏洞堵上。只回滚不堵漏洞下一轮训练它还会从同一个地方钻出来。”11、badcase 怎么回流“badcase 怎么回流”“先归因再分流不能一股脑塞回训练集。做错了的坏例修复成正样本进 SFT 数据不算错但答得不好的坏例做成偏好对去训 reward model还有一类是 verifier 自己判错了要修的是评测环境不是模型。”“归因不能拍脑袋要给坏例打标签是检索没召回、工具调用出错还是推理链断了。标签攒够量模型的短板分布一目了然下一轮数据往哪补也就清楚了。”“回流有三条工程纪律去重、控制配比防止灾难遗忘、每个修复过的坏例都加进回归评测集防止同类问题复发。”“badcase 不是垃圾是带着精确坐标的免费训练信号。”12、PPO 里的 value model 和 reward model 怎么训练“PPO 里的 value model 和 reward model分别怎么训练”“先分清两个模型的角色。奖励模型管‘这个结果值多少分’价值模型value model管‘当前状态往后预计还能拿多少分’一个评结果一个估预期。”“reward model 在强化学习开始之前训好拿偏好对做排序损失通常从 SFT 模型初始化训完就冻结。value model 是在 PPO 过程中和策略模型一起在线更新的训练目标就是把‘往后还能拿多少分’估准。”“奖励里还要加一项 KL 惩罚约束策略模型别跑得离 SFT 模型太远。跑远了语言质量会崩reward 再高也没用。”“一个容易踩的坑训练初期先冻住策略模型单独把 value model 预热几步。不预热的话早期的优势估计全是噪声策略一上来就被带偏。”“PPO 训练时策略、参考也就是那份冻结的 SFT 模型、奖励、价值四份模型的权重要同时放在显存里这个开销就是后来 GRPO 把 value model 省掉的最大动机。”13、GRPO 的 reward 能不能迁移到 PPO老王追问“GRPO 的 reward 能不能直接迁到 PPO 上用”“能两者吃的是同一种东西一条回答对应一个分数的标量奖励。真正的区别不在 reward在优势估计的方式。”“GRPO 对同一个问题采一组回答用组内的平均分当基线省掉了 value modelPPO 用 value model 来估基线。”“所以迁移时 reward 和 verifier 原样能用要补的是给 PPO 训一个 value model。另外注意奖励的尺度GRPO 的组内归一化在 PPO 里没有对应机制尺度不齐训练容易震荡。”14、Agent 任务怎么评测“Agent 任务怎么评测”“分三层指标。结果层看任务的成功率前提是环境可复位、产物能客观判定过程层看步数、token 成本、工具调用的成功率两个 Agent 都能完成同一个任务步数差三倍就是水平差距稳定层看同一任务跑多次的方差连续多次全过才算真会偶尔过一次不算。”“环境可复位是个工程活用容器或快照保证每次评测都从同一个状态出发不然上一次运行留下的副作用会污染下一次的结果。评测集还要防泄漏进过训练数据的任务必须踢出去。”“评不了硬指标的维度用模型当裁判但裁判要定期人工抽检校准不然评测体系自己先漂移了。”15、Code Agent 的 verifier 怎么设计老王看了眼时间问出最后一题“Code Agent 的 verifier 怎么设计”“分四层从便宜到贵”语法层编译或语法检查秒级出结果最先拦测试层跑单元测试和集成测试以“失败转通过”为核心判定静态层类型检查、风格扫描、依赖安全评审层模型或人做代码评审兜住前三层测不出的设计问题测试层的“失败转通过”是什么意思“判定一个修复是否成立要求对应的测试在修复之前必须失败、修复之后必须通过两头都验防的是‘测试本来就能通过’的假阳性。”“防作弊要从运行环境下手测试文件只读、沙箱执行、产物校验一样都不能省。”“PaiCLI 里我落地了一个 MVP 版本。写完 Python 文件立即做语法编译检查报错直接附在工具结果里回给模型当轮就改多 Agent 模式里有专职的审查者角色产出不合格就打回重做最多两次。”学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

【Bug已解决】[REQUEST]Will zero 3 support diffrent module usage? 解决方案

【Bug已解决】[REQUEST]Will zero 3 support diffrent module usage? 解决方案

【Bug已解决】[REQUEST]Will zero 3 support diffrent module usage? 解决方案 一、现象长什么样 有用户提了一个功能请求(feature request):「ZeRO-3 能否支持『不同的 module usage』?」这里的「different module usage」指的是…

2026/7/23 3:04:59阅读更多 →
【Bug已解决】EvoformerAttention should auto-detect CUTLASS instead of requiring CUTLASS_PATH 解决方案

【Bug已解决】EvoformerAttention should auto-detect CUTLASS instead of requiring CUTLASS_PATH 解决方案

【Bug已解决】EvoformerAttention should auto-detect CUTLASS instead of requiring CUTLASS_PATH 解决方案 一、现象长什么样 在 DeepSpeed 里使用 EvoformerAttention(一种用于蛋白质结构模型、带自定义 CUDA/Triton kernel 的注意力实现)时&#xff…

2026/7/23 3:04:59阅读更多 →
【Bug已解决】[BUG] FastFileWriter leaks one fd per save, causing orphan inodes and filesystem ENOSPC on c

【Bug已解决】[BUG] FastFileWriter leaks one fd per save, causing orphan inodes and filesystem ENOSPC on c

【Bug已解决】[BUG] FastFileWriter leaks one fd per save, causing orphan inodes and filesystem ENOSPC on checkpoint rotation workloads 解决方案 一、现象长什么样 在 DeepSpeed 做 checkpoint 轮换(checkpoint rotation,即每隔若干步保存一次、…

2026/7/23 3:04:59阅读更多 →
深入解析Tiva ADC中断与触发机制:从寄存器到多序列实战

深入解析Tiva ADC中断与触发机制:从寄存器到多序列实战

1. 从寄存器到实战:理解ADC中断与触发机制的核心在嵌入式系统里做数据采集,ADC(模数转换器)绝对是核心外设之一。但很多开发者,尤其是刚接触TI Tiva系列MCU的朋友,往往只停留在调用驱动库函数完成一次转换的…

2026/7/23 4:29:13阅读更多 →
C++实现模糊综合评价:从原理到工程实践

C++实现模糊综合评价:从原理到工程实践

1. 项目概述:当C遇上模糊综合评价最近在做一个决策支持相关的项目,里面涉及到对多个非量化因素进行综合评判。比如,要评估一个软件项目的风险等级,影响因素有“技术复杂度”、“团队经验”、“需求稳定性”等等,这些玩…

2026/7/23 4:29:13阅读更多 →
别再给 Coding Agent 手搓工具封装:用 QVeris 搭一个开发者自动化 Agent

别再给 Coding Agent 手搓工具封装:用 QVeris 搭一个开发者自动化 Agent

现在的 Coding Agent 已经很会写代码了,但一旦任务离开本地仓库,它的能力就会迅速缩水:查最新 API 文档、研究陌生报错、核对依赖兼容性、查询服务状态、整理 Issue 上下文……这些工作都需要访问真实的外部工具和数据。 问题在于&#xff0…

2026/7/23 4:29:13阅读更多 →
德钟壶稳坐茶席,红紫窑变自有分量

德钟壶稳坐茶席,红紫窑变自有分量

钟腹稳茶台, 红紫绕壶身。 火色虽浓重, 端坐自安然。 德钟壶讲究的是一个“稳”字。壶身饱满,重心落得低,壶嘴与壶把左右舒展,整把壶像稳稳坐在茶席上。 这份端正,正好承住了红紫窑变的浓厚。颜色再丰富&am…

2026/7/23 4:29:13阅读更多 →
TI DCAN寄存器深度解析:从错误计数到消息对象的高效管理

TI DCAN寄存器深度解析:从错误计数到消息对象的高效管理

1. DCAN控制寄存器:从错误计数到消息处理的核心枢纽在嵌入式系统,尤其是汽车电子和工业控制领域,控制器局域网(CAN)总线是连接各个电子控制单元(ECU)的神经系统。它的可靠性直接决定了整个系统的…

2026/7/23 4:29:13阅读更多 →
SolidWorks 2021许可证报错解决方案与验证机制解析

SolidWorks 2021许可证报错解决方案与验证机制解析

1. SolidWorks 2021许可证报错问题概述遇到SolidWorks 2021提示"无法获得许可证,无效的不一致的使用许可证号码"时,大多数用户的第一反应是重新安装软件。但根据我多年处理SolidWorks许可证问题的经验,90%的情况下根本不需要重装。…

2026/7/23 4:27:13阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →