朱建辉
AI 测试工程师 · 4 年 AI 与算法测试经验 · 现居杭州
概况
- 4 年 AI 与算法测试经验,连续两年绩效 A+,聚焦模型评测、Agent 评测及 AI 质量保障
- 熟悉 LLM、VLM 及 Agent 评测,擅长 Benchmark 构建、效果分析、Badcase 定位与评测标准制定
- 具备测试工程化与性能测试经验,熟练运用 Python 构建自动化评测工具,推动产品迭代与质量回归
工作经历
光速进化智能有限公司
AI 测试工程师(AI Home Center)| 2026.05 – 至今
liko.ai 研发端侧 AI 家庭智能中枢硬件与 AI 原生摄像头,打造本地隐私优先、具备场景理解推理能力的新一代智能家居系统解决方案。
- 主导 AI 评测体系建设,推动模型评测流程标准化与自动化
- 负责 CV、VLM、Face、ReID 及视频理解模型评测方案设计与效果分析
- 运用 LLM-as-Judge 构建模型自动化评估流程,提升评测效率与一致性
- 搭建端到端自动化评测平台,打通数据、评测执行与结果分析链路
- 基于业务场景构建专属 Benchmark,支撑模型版本迭代与效果回归
- 基于行业 Benchmark 开展模型复现与对标分析,定位能力短板
- 制定数据采集与标注规范,协同标注团队完成数据集验收与质量管控
奇富科技(原 360 数科)
AI 测试工程师(AI 信贷员)| 2025.07 – 2026.04
信贷超级智能体的核心模块之一:融合文本、图像、语音等多模态数据,动态推荐目标客户、优化营销策略,助力银行实现普惠信贷精准触达。
- 2025 下半年提交有效缺陷 327 个,位列 25 人团队 Top 2
- 主导多模态测试,支撑 2 家银行 AI 项目零 P0/P1 缺陷交付
- 基于 Langfuse 追踪 Agent 链路,分析 Prompt、模型输出及工具调用,快速定位异常
- 主导 Agent 场景化测试用例集建设、整理迭代及日常维护
- 负责授信、营业执照等工具开发,单次节省 10 分钟,累计调用超千次
- 参与银行 AI 项目质量保障,推进测试问题定位、缺陷闭环及交付质量提升
滴普科技股份有限公司
AI 测试工程师 | 2023.02 – 2025.06
AI 数据决策平台(2023.09 – 2025.06):基于大模型的数据智能问答平台,支持自然语言转 SQL 查询,降低业务用户数据分析门槛,助力企业实现数据驱动高效决策。
- 全司唯一以 P5 职级独立负责产品线测试(其他产品线均由 P7 带队)
- 负责 Agent 效果验证,通过 Badcase 反馈、RAG 测试等将准确率提升至 98%
- 开发可复用评测系统,每次迭代验证 1400+ 客户真实问法,单次节省人力 4 天
- 主导接口自动化框架搭建与实现,核心业务回归自动化率 100%
- 实现跨系统(X86/ARM/Windows)脚本兼容,每次部署后提效 80% 以上
- 主导 Agent 压测,推动 TPS 从 1.5/s 提升至 20/s,累计支撑 30w+ 问答
- 主导 PostgreSQL/StarRocks/Kingbase 等多数据库性能对比,为选型提供数据支撑
核心技能
- 模型评测:LLM / VLM 评测方法与指标设计、测试集构建、效果分析;Benchmark 设计与 LLM-as-Judge 自动化评估实践
- Agent 评测:任务完成率、工具调用准确性及端到端业务效果验证;基于 Langfuse 追踪执行链路,定位 Prompt、模型输出及工具调用异常
- 模型原理:理解 Transformer、预训练与后训练(SFT、RLHF)及推理优化原理;具备 PyTorch、LoRA 实践经验,熟悉模型训练流程与实验评估
- 工程能力:熟练运用 Python、Pytest 开展自动化测试与评测工具开发,具备 AI 辅助编程能力
- 性能测试:熟练运用 JMeter、Locust,具备 Agent 吞吐量分析及性能瓶颈定位能力
教育背景
广东技术师范大学 · 全日制本科 | 2019.09 – 2023.06
联系方式
- Email:zmrzhu@163.com
- GitHub:https://github.com/742402906