大模型算法工程师

从模型能力到系统能力

把模型能力,做成可上线、可评测、可维护的系统。

关注 RAG、Agent、工具调用、评测与可观测性如何经得起真实业务使用。

我更关心一个问题:模型能力如何进入真实系统。写作会沿着 RAG、Agent Runtime、评测和工程边界持续展开。

01

RAG & Document AI

复杂文档解析、结构保护、混合检索、重排与评测闭环。

02

Agent Runtime

状态、工具调用、审批、事件日志和可观测性,而不是循环调用模型。

03

Evaluation & Reliability

用任务集、trace、人工审核和指标体系判断 AI 系统是否可靠。

04

Production Engineering

权限、延迟、失败归因、成本和维护边界,决定模型能力能否上线。

这里预留一个视觉展示区,用来承载项目截图、架构图、工作现场照片或你想长期展示的代表性图片。

格式
宽幅图片 / 系统图 / 产品截图
作用
让页面在纯文本之外有一个记忆点
首页图片槽位:视觉归档占位
系统图占位图片位置

RAG

复杂文档解析、切分、检索、重排与评测。

Agent

状态管理、工具调用、人工审批、日志与可观测性。

评测

任务数据集、trace 分析、答案质量和可靠性验证。

工程

权限、延迟、失败归因、成本与可维护边界。

我的工作重心从模型能力本身,逐渐转向模型如何进入真实业务系统:数据、权限、流程、评测和工程边界,往往比一次模型调用更决定产品质量。

2026Intelligent Bidding SystemDocument AI / RAG / Agent 工作流
2025Enterprise OA Agent工具调用 / 审批 / 可观测性
2024AI Browser搜索 / 浏览器 Agent / VLLM