AI 应用如何做日志、监控、成本统计和效果评估?

AI 应用如何做日志、监控、成本统计和效果评估?
这道题考的是 AI 应用全链路可观测性体系的建设能力。面试官想看你能不能把 AI 系统"看清楚、管起来"——包括训练阶段怎么监控、推理阶段怎么追踪、成本怎么归集、Agent 效果怎么评估。
板块1:AI可观测性三剑客——日志、指标、追踪
AI 系统的可观测性就像给工厂装监控系统,离不开三样东西:日志、指标、链路追踪。
日志是事件记录,像监控摄像头的录像。你想知道某个任务为什么失败了、日志里写的清清楚楚——什么时间、哪个任务、出了什么错。
指标是聚合数据,像生产报表。GPU 利用率 80%、平均延迟 200ms、QPS 1000——这些数字帮你快速判断系统健康不健康。
链路追踪是把请求从头到尾串起来,像追溯零件从入库到成品的完整路径。用户的请求经过哪些服务、每个环节耗时多少、哪个节点拖了后腿,追踪一拉全知道。
三个东西各有用处:日志用来查问题、指标用来看趋势、追踪用来定位瓶颈。

板块2:训练监控 vs 推理监控——关注点差异
训练阶段和推理阶段的监控重点完全不一样,别混为一谈。
训练阶段像"考试备考",重点是效率。你要盯:
- 任务完成率:多少训练任务成功跑完了
- 排队时间:任务等资源等了多久
- 资源浪费率:GPU 分下去了但没跑满的时间占比
- 失败率:任务为什么挂、挂在哪里
光看 GPU 利用率 100% 没用,还得看是不是有效利用——跑了个死循环 GPU 利用率也是 100%,但模型没训练出来。
推理阶段像"正式考试",重点是 SLA 和成本。你要盯:
- 延迟:P50、P99 响应时间是多少
- 吞吐量:每秒能处理多少请求
- 错误率:有多少请求返回了异常
- 单位推理成本:每千次调用花多少钱
训练看"能不能跑完",推理看"能不能扛住"。

板块3:多维度成本归集与控制
AI 推理的成本是个大头,不能稀里糊涂地烧。
成本主要由三块构成:GPU 算力成本、内存占用、API 调用费用。如果是调用第三方模型,API 费用往往是最大的那块。
成本归集要按维度来:
按租户归集——多租户场景下,A 租户和 B 租户各消耗了多少资源,得算清楚。想象成水电费账单,按户计量才公平。
按模型版本归集——同一个模型 v1 和 v2 版本,哪个更费钱、哪个效果更好,投入产出比得算出来。
按调用场景归集——搜索场景和对话场景的流量特征完全不同,成本结构也不一样。
治理成本的核心思路:能缓存的缓存、能批处理的批处理、能降级的降级。比如相似问题走缓存、凌晨低峰期批量处理、非核心请求降级到小模型。

板块4:Agent效果评估四步法与主流框架
Agent(智能体)的效果怎么评估?这个问题比评估普通模型难多了,因为 Agent 要做决策、调用工具、多轮交互。
评估 Agent 有个四步法:
第一步:选指标——你要评估什么?任务完成率、决策准确率、工具调用准确率、响应质量?
第二步:建测试集——准备好能覆盖真实场景的测试用例。想象成驾照考试的题目库,得包含各种路况。
第三步:选评估方法——人工评估最准但贵;LLM as Judge 用大模型打分,成本低但有偏差;规则评估最快但覆盖不了复杂场景。
第四步:分析优化——看评估结果,找薄弱环节,针对性优化。
主流评估框架你知道几个?
AgentBench 覆盖 8 大场景,适合全面评测;τ-bench 聚焦对话评测,看 Agent 能不能正确理解意图、调用工具;AgentBoard 支持细粒度调试,适合开发阶段用。
选框架要看场景:正式评测用 AgentBench,调试验证用 AgentBoard。
有个坑要提醒:LLM as Judge 不是万能的。对于高风险场景,比如医疗、法律,AI 打分可能出错,必须人工兜底。

板块5:告警治理——告别告警疲劳
告警多到看不过来,比没有告警还糟糕。
告警治理有三板斧:分级、去重、聚合。
分级——告警要分 P0 到 P3:
- P0 是业务挂了,得立刻处理
- P1 是核心指标异常,15 分钟内响应
- P2 是性能下降,1 小时内处理
- P3 是警告,可以放一放
想象成医院分诊台,根据病情严重程度分配医生,避免小病占用 ICU 资源。
去重——同一个问题一分钟内只告一次,别轰炸你。比如数据库连接失败,一分钟报一次就够了,别每秒都告。
聚合——多个相关告警合并成一个。比如一个服务 down 了导致 100 个实例都告警,合并成一个"XX 服务不可用",别让你看 100 条告警。
关键指标要重点盯:任务完成率、决策准确率、工具调用准确率。这些是 AI 系统特有的指标,传统的 CPU、内存监控只是基础。

面试怎么答
基础版:
AI 系统的可观测性由日志、指标、链路追踪三部分组成。训练阶段我关注任务完成率、排队时间、资源浪费率;推理阶段重点看延迟、吞吐量、单位推理成本。成本按租户、模型版本、调用场景多维度归集。Agent 效果评估我用过四步法:选指标、建测试集、选评估方法、分析优化,常用 AgentBench 框架做全面评测。
加分版:
光看 GPU 利用率不够,训练阶段要结合任务完成率和资源浪费率来评估。推理成本由 GPU 算力、内存占用、API 调用三块构成,治理思路是缓存、批处理、降级。Agent 评估框架我对比过 AgentBench、τ-bench、AgentBoard,分别适用不同场景。LLM as Judge 有局限性,高风险场景需要人工兜底。告警治理要分级、去重、聚合,避免告警疲劳。
一句话总结
AI 可观测性体系的核心是日志、指标、追踪三位一体,训练监控看效率、推理监控看 SLA,成本归集按租户按模型,Agent 评估用四步法 + 主流框架,告警治理靠分级、去重、聚合。
