AI Agent 落地部署手册

让每个人都看懂:部署一个 AI Agent 到底在管什么

无论你是使用 Agent 的个人、推动团队协作的管理者、负责运维的工程师,还是制定评测标准的 AI 中台负责人,这份手册帮你快速定位自己需要关注的资产、理解自己的职责、掌握实操方法。

v8.1 · 2026-08-06 · 桩基理论 + 落地形态 + 质量评分卡

框架是他们的,资产是你的

OpenAI、Anthropic、Google 每年数十亿美元砸在模型训练与推理基础设施上,WorkBuddy 这样的传统大厂用成熟工程资源做通用平台。那是地基,不由我们来建。但很多团队一眼就看出脚下是流沙,却花巨量精力去压地基。自建模型网关、自研评测平台、从零搭知识库引擎。做了半年还没压稳,后来者什么都没做,直接用上了大厂更好的地基。回头一看,自己那套连维护都成了负资产。真正属于你的从来不是地基,是桩。业务规则写成独立文件,知识用标准化格式持久存储,技能用纯文本打包,换什么 Agent 都能平移复用。手册列的 33 项资产就是你的桩。

流沙上建房 vs 纯文本打桩:桩基理论对比图
Skills
技能文件
MCP
外部连接协议
Hooks
自动化触发
Rules
项目约束文件
Commands
快捷指令
Prompts
提示词模板
Scripts
自动化脚本
Tests
测试套件
一个请求的完整旅程
当你向 AI 助手提问时,背后发生了什么?
用户提问
"帮我分析这份销售数据"
大脑思考
理解意图、拆解步骤
调用工具
读文件、搜索、查数据库
查知识+回忆
检索知识库、回忆偏好
检查输出
安全护栏审核
返回结果
图表+分析结论
全程有「记忆」参与
全程有「安全护栏」守护
每一步都有日志可追溯
8
资产大类
33
具体资产项
5
角色视角
5+2
评估维度

一层一层搭起来

从上到下:用户看到什么 → 背后靠什么支撑 → 安全如何贯穿始终。

用户层
个人用户
团队协作
快捷指令
大脑层
AI 大脑
网关调度
推理引擎
全局指令
专家人设
知识层
知识库
记忆库
业务数据库
智能检索
上下文文件
能力层
技能库
外部连接器
命令行工具
原子能力
网络搜索
工作流编排
基础设施
服务器
监控告警
定时任务
密钥管理
对话日志
审计追踪
质量保障
评测数据集
指标体系
评测报告
版本发布
功能开关
变更日志
安全护栏 & 权限管控 — 贯穿每一层

33 项资产如何构成一个完整的 Agent

8 大类资产按层级关系组织,从用户触达到底层基础设施,再到质量保障闭环。

📐 结构图较宽,手机上已收起;下方 8 张分类卡片包含同样的全部内容。

AI Agent 部署资产 核心行为5 项 全局指令 快捷指令 专家人设 能力说明 安全护栏 知识与记忆4 项 知识库 记忆库 业务数据库 上下文文件 能力与工具6 项 技能库 外部连接器 命令行工具 原子能力库 网络搜索 工作流编排 AI 引擎4 项 大脑+网关 推理引擎 智能检索 指令组装 安全与权限3 项 权限管控 审计日志 密钥凭证 评测与质量4 项 评测数据集 指标体系 评测报告 质量标杆库 基础设施4 项 服务器容器 对话日志 监控告警 定时任务 版本与发布3 项 版本标签 变更日志 功能开关 5 类角色 × 6 个评估维度 = 每项资产都有 Owner / Consumer / Verifier 个人使用者 团队协作 维护者/运维 版本迭代者 评测效果评价者 基准线

核心行为

5 项
全局指令快捷指令专家人设能力说明书安全护栏

知识与记忆

4 项
知识库记忆库业务数据库上下文文件

能力与工具

6 项
技能库外部连接器命令行工具原子能力库网络搜索工作流编排

AI 引擎

4 项
AI 大脑+网关推理引擎智能检索指令组装

安全与权限

3 项
权限管控审计日志密钥凭证

评测与质量

4 项
评测数据集指标体系评测报告质量标杆库

基础设施

4 项
服务器容器对话日志监控告警定时任务

版本与发布

3 项
版本标签变更日志功能开关

落地形态:每个都对应一项实战资产

上面 33 项资产是"要管什么"的分类学。下面是部分资产在实际工具中的落地形态。以下仅为举例,不是封闭清单。Assets 的具体形态随工具生态持续演进,但核心不变:资产必须是纯文本、跨工具可平移的独立文件。

Skills
技能

告诉 AI"按这个流程走"

一个 Skill 就是一个 Markdown 文件,包含指令、模板和工作流程。纯文本,跨工具可复用,不绑定任何特定模型,换一个支持 Skill 机制的工具,文件拷过去就能用。
能力与工具对应资产:技能库文件形态:skills/ 目录下的 .md
MCP
Model Context Protocol

AI 连接外部工具的标准化插座

Anthropic 推出的开放协议,让 AI 通过统一接口连接数据库、API、文件系统。每个 MCP Server 是一个独立进程:数据源属于 PM,查询逻辑属于项目,换一个支持 MCP 的 AI 工具,同一个 Server 照用不误。
能力与工具对应资产:外部连接器配置位置:settings.json → mcpServers
Hooks
钩子 / 自动化

"当 X 发生时,自动执行 Y"

事件驱动的自动化。每次调用 Bash 前检查安全性、会话结束前保存上下文、文件写入后自动格式化。Hooks 在不打断工作流的前提下,把安全与质量无声织入每次操作。
安全与权限对应资产:安全护栏配置位置:settings.json → hooks
Rules
规则 / 宪章

AI 每次启动必读的约束文件

全部资产中最重要的桩。定义项目是什么、技术栈为何、绝不能犯什么错、与 PM 如何配合。被错误喂养、随项目生长,纯文本,拷贝即生效,是所有规则资产的不动锚点。
核心行为对应资产:全局指令文件名:CLAUDE.md / AGENTS.md
Commands
命令 / 快捷指令

一键触发的高频操作入口

落地形态里唯一面向"人直接操作"的形态。内置命令覆盖常用场景,自定义命令将重复 prompt 封装为单次输入,是用户与 Agent 最短距离的触点。
核心行为对应资产:快捷指令使用方式:/ 斜杠命令 + 自定义命令
Prompts
提示词模板

沉淀下来的高质量提问方式

把验证过有效的提示词写成模板文件,团队共享、版本管理。换模型时模板是调优的起点,而不是从零重写。纯文本,天然可移植。
核心行为对应资产:快捷指令 / 指令组装文件形态:prompts/ 目录下的 .md / .txt
Scripts
自动化脚本

Hooks 和定时任务背后的可执行资产

每条自动化规则背后都是一段脚本:安全检查、格式化、数据备份。脚本随项目进版本库,换平台时逻辑可以整体搬走,只改触发方式的接线。
安全与权限对应资产:安全护栏 / 定时任务文件形态:scripts/ 目录下的可执行文件
Tests
测试套件

用可执行用例锁住质量标准

BDD 场景、评测数据集、回归用例,都是把"什么叫好"写成机器可验证的断言。它们是评测体系的实体,也是换 Agent 后第一时间跑起来验证新效果的基准。
评测与质量对应资产:评测数据集 / 指标体系文件形态:tests/ 与 evals/ 目录
所承载的资产(手册类别)编号
Skills核心行为 → 能力说明书 / 专家人设 · 能力与工具 → 技能库#04, #09
MCP能力与工具 → 外部连接器 · 安全与权限 → 密钥凭证#10, #24
Hooks安全与权限 → 安全护栏 / 审计日志 · 评测与质量 → 自动化#06, #25, #27
Rules核心行为 → 全局指令 · 知识与记忆 → 上下文文件#01, #08
Commands核心行为 → 快捷指令 · 能力与工具 → 工作流编排#02, #14
Prompts核心行为 → 快捷指令 · AI 引擎 → 指令组装
Scripts安全与权限 → 安全护栏 · 基础设施 → 定时任务
Tests评测与质量 → 评测数据集 / 指标体系

不同角色,各自关注什么?

每个人不需要管全部 33 项资产。找到你的角色,聚焦你需要关注的那几项。

个人使用者

日常用户

你只需要关心一件事:Agent 能不能帮我把活干好?

了解 Agent 能做什么,自定义人设语气,用快捷指令一键完成高频操作。

你要维护的:个人记忆库、快捷指令、个人知识库。
查看你关注的资产

团队协作

团队管理者

核心目标:让所有人用同一个 Agent 时,体验一致、知识共享、效率倍增。

建立团队公共知识库,统一行为基线和人设风格,共享技能和工作流。

你要维护的:团队知识库、共享技能库、工作流编排、权限模型。
查看你关注的资产

维护者 / 运维

技术运维

你是 Agent 的"保姆",确保它 7x24 稳定运行,出问题能快速恢复。

关注服务器健康、模型网关可用性、工具连接器连通性、密钥凭证安全。

你要维护的:环境配置、监控告警、密钥凭证、审计日志、定时任务。
查看你关注的资产

版本迭代者

产品负责人

你负责 Agent 的持续进化,每次升级都要让它变更好,而不是变差。

管理版本号策略、记录变更动机和影响、控制灰度发布。

你要维护的:版本标签、变更日志、功能开关。
查看你关注的资产

评测效果评价者

AI 中台负责人

你是 Agent 质量的最终裁判,你说了算"这个版本能不能上线"。

三件套:评测数据集、指标体系、评测报告。为每个资产设定基准线。

你要维护的:评测数据集、指标体系、评测报告、基准线定义。
查看你关注的资产

33 项资产,逐项拆解

每项资产对 5 类角色的具体作用 + 基准线参考。悬停标签切换分类,点击可锁定。

悬停标签切换分类,点击可锁定当前标签
资产对象个人团队协作维护者迭代者评测者基准线参考
全局指令基础
System Prompt
决定回答风格与理解深度统一行为基线第一排查项核心变更需记录动机变更前后对比任务完成率>=85%;安全拦截100%
快捷指令基础
Prompt Templates
高频操作一键触发标准化指令库监控使用率变更需有记录执行成功率覆盖>=80%高频场景;成功率>=95%
专家人设基础
Persona / SOUL
语气影响信任感品牌一致性客诉判断参照验证满意度影响主观评分满意度>=4.0/5
能力说明书基础
Agent Manifest
建立正确预期新成员了解边界运维第一参考升级时同步更新按声明设计用例覆盖率100%;文档与行为一致
安全护栏基础
Guardrails
安全底线企业合规屏障误拦/漏拦调优新威胁响应红队通过率安全拦截100%;误拦率<=2%
资产对象个人团队协作维护者迭代者评测者基准线参考
知识库基础
Knowledge Base
个性化知识公共知识沉淀过期检测增删改有记录召回率、忠实度召回率>=90%;忠实度>=95%
记忆库进阶
Memory System
跨会话记住偏好项目级记忆延续容量、隐私合规架构演进召回准确率准确率>=90%;隐私合规100%
业务数据库进阶
Database
个人数据持久存储共享数据层备份、性能调优结构变更可回退读写准确性可用性>=99.9%;延迟<=50ms
上下文文件基础
Context Files
理解工作环境协作约定数字化加载性能协议演进指令遵循率加载<=200ms;遵循率>=90%
资产对象个人团队协作维护者迭代者评测者基准线参考
技能库进阶
Skills
安装/自定义技能共享最佳实践冲突检测向后兼容成功率成功率>=95%
外部连接器进阶
MCP Services
连接外部工具统一管控集成连接稳定性协议兼容调用成功率可用性>=99.5%
命令行工具进阶
CLI Tools
本地效率工具跨机器一致分发更新兼容旧脚本跨平台兼容通过率100%
原子能力库高级
Capability Library
多模态即调即用统一封装计费故障降级逐步放量质量评分可用性>=99%
网络搜索进阶
Web Search
实时获取信息信息源管控缓存策略多源聚合引用准确性可用率>=99%
工作流编排高级
Workflow
流程自动化标准流程固化失败重试逐步放量完成率完成率>=90%
资产对象个人团队协作维护者迭代者评测者基准线参考
AI 大脑+网关高级
LLM & Gateway
智商上限智能分配模型限流、负载均衡逐步放量跨模型对比可用性>=99.9%;延迟<=3s
推理引擎高级
Agent Framework
规划与纠错统一推理方式死循环检测全量回归纠错率完成率>=80%
智能检索高级
AI Retrieval
按画像匹配跨系统搜索召回率监控模型升级对比检索准确率召回率>=85%
指令组装进阶
Prompt Engine
影响精准度共享组装规范注入正确性覆盖全场景质量影响错误率=0
资产对象个人团队协作维护者迭代者评测者基准线参考
权限管控进阶
RBAC
访问边界角色分级账号管理权限演进越权测试越权=0
审计日志基础
Audit Logs
历史回溯全程可追溯合规留存格式兼容完整性记录率100%
密钥凭证进阶
API Keys
费用控制凭证轮转泄露应急加密升级有效性泄露=0;轮转<=90天
资产对象个人团队协作维护者迭代者评测者基准线参考
评测数据集进阶
Eval Datasets
提交测试用例统一衡量尺子标注质量配套新用例核心对象覆盖>=90%场景
指标体系高级
Eval Metrics
质量信号质量共识计算准确性新维度核心对象误差=0
评测报告进阶
Reports
了解趋势决策依据自动化增益分析核心产出自动化率>=90%
质量标杆库进阶
Showcase Library
个人水准参照团队共同标准定期更新标杆迭代核心参照每里程碑>=1 件入库
资产对象个人团队协作维护者迭代者评测者基准线参考
服务器容器进阶
Environment
环境一致环境统一核心对象代码化排除干扰回退<=5min
对话日志基础
Logs
历史回溯行为分析脱敏合规格式兼容评测素材完整率100%
监控告警进阶
Monitoring
可用性感知健康看板核心对象重点观察触发评测发现<=5min
定时任务基础
Cron
定时报告统一调度漏执行监控评估影响成功率成功率>=99.9%
资产对象个人团队协作维护者迭代者评测者基准线参考
版本标签基础
Version Tags
版本选择统一基线快速回退核心对象版本对比回退100%
变更日志基础
Changelog
判断升级信息同步故障排查核心对象关联分析覆盖100%
功能开关进阶
Feature Flags
体验新功能灰度节奏清理过期并行控制A/B对比生效<=1min

抽象概念在具体工具里长什么样?

33 项资产是抽象分类。在实际工作中,它们对应到具体的文件、配置、服务。以下按主流工具逐项映射,帮你从"概念理解"落地到"动手操作"。

核心行为 + 知识记忆
资产Claude CodeCursor / QwenWork企业 AI 中台个人要维护什么
全局指令CLAUDE.md.cursorrules AGENTS.mdSystem Prompt 配置页通常由团队统一管理。个人可在本地 CLAUDE.md 补充偏好。
快捷指令/slash commandsSkills / 自定义指令Prompt 模板库个人可创建高频操作的快捷指令。
专家人设CLAUDE.md 人格段落SOUL.mdAgent 人设配置个人可调整语气偏好。
安全护栏内置安全层 + permission prompts内容过滤配置Guardrails 服务个人不需要维护,由安全团队配置。
知识库项目文件自动索引@codebase / RAG 文档库向量数据库个人可上传私有文档。
记忆库MEMORY.md / USER.mdMemory 系统用户画像服务Agent 自动维护。个人通过对话告诉 Agent 偏好。
上下文文件CLAUDE.md / AGENTS.mdAGENTS.md / USER.md项目配置中心个人可编辑项目根目录的上下文文件。
能力工具 + AI 引擎
资产Claude CodeCursor / QwenWork企业 AI 中台个人要维护什么
技能库内置工具集Skills 目录 / SKILL.md技能市场个人可安装/卸载/创建技能。
外部连接器MCP ServerMCP 配置 / Connector集成平台 / API Gateway个人可配置 MCP 连接自己的工具。
命令行工具Bash / git / npmTerminal 集成CI/CD Pipeline不需要维护。Agent 自动调用。
原子能力库内置图片理解ImageGen / TTSDALL-E / 语音 API不需要维护。由平台接入。
网络搜索内置搜索WebSearchBing / Google API不需要维护。
AI 大脑+网关Claude 模型模型选择器LiteLLM / 自建网关个人可选模型,网关由运维管理。
推理引擎内置 ReAct 循环Agent 模式LangGraph / AutoGen不需要维护。由工程团队管理。
安全 / 基础设施 / 版本
资产Claude CodeCursor / QwenWork企业 AI 中台个人要维护什么
权限管控permission promptsRBAC 配置IAM / RBAC不需要维护。遵守规则即可。
密钥凭证.env 环境变量API Key 管理Vault / KMS个人管理自己的 API Key。
监控告警Anthropic 监控内置健康检查Prometheus + Grafana不需要维护。异常时反馈给运维。
版本标签Anthropic 版本产品版本号Git Tag / SemVer个人选择版本。版本管理由迭代者负责。
功能开关实验性功能开关Feature Flag 平台个人可开关实验性功能。

产品经理需要重点维护哪些资产?

AI 时代 PM 不再当"二传手"——不等别人实现。PM 对着 AI 把需求说明白、把验收标准讲清楚,让 AI 充当交互、开发、测试。PM 只做三件事:说清楚要什么、推进度、查结果。

定方向 — 这个项目是什么、给谁用、不放什么进来 项目一开始定好,很少改

项目 Brief(brief.md)

谁在用、解决什么痛点、跟别人有什么不一样、这次不做哪些。文件 brief.md 放项目根目录。以前写几十页 PRD,现在一页纸就够了——AI 不需要被说服,它需要方向 + 边界。

项目上下文(AGENTS.md)

用户画像、使用场景、业务常用词。写进 AGENTS.md(或 CLAUDE.md),AI 每次自动加载——不用反复解释"我们产品是干嘛的"。
做功能 — 一个功能一个功能来,每次说清楚"要什么"和"不能怎样" 每做一个功能就补

功能规格(specs/*.md)

别写需求文档。每功能建一个 specs/功能名.md:一句话描述 + 截图 + 几条绝对不能干的事。AI 自己搞定交互和代码实现——PM 不用画 UI。

异常场景(同 spec 文件)

AI 最容易只做 happy path。每功能顺手写一句:搜不到/断网/空数据/没权限时各长什么样。写在同一份 specs/功能名.md 里就行。
验收 — PM 说了算:能不能上线 每次做完都要跑

验收清单(checklist/*.md)

别写 GWT、别写 BDD——PM 不用学那些。就写"打开哪→点哪→看到什么算过关"。文件 checklist/功能名.md,AI 做一条、验一条、打勾——打完就上线。

发布判定(你说了算)

AI 说"做完了"不等于真的做完了。PM 打开看:能用→通过;不太对→截图让 AI 改;完全不是你要的→打回去、把话说更清楚。判定标准永远是验收清单上的那几条。

三个角色,三份清单

33 项资产不需要每个人都管。以下是三个关键角色的"最小维护清单":只维护这些,就能让 Agent 从"能用"变成"好用"。

作为个人,最应该维护哪些? 3 项核心资产

个人记忆库(Memory)

你的偏好、习惯、历史决策。Agent 通过记忆库"记住"你,下次交互更顺畅。维护方式:主动告诉 Agent 你的偏好(如"我喜欢用柱状图""代码风格用 Prettier"),Agent 会自动存入记忆。

快捷指令(Prompt Templates)

你高频操作的"一键触发"。维护方式:把重复性操作封装成快捷指令(如"日报生成""代码审查""会议纪要"),下次直接调用,节省 80% 的重复输入时间。

个人知识库(Knowledge Base)

你的私有文档、笔记、参考资料。维护方式:上传个人文档到知识库,Agent 回答时会优先参考你的私有知识,而不是通用知识。
作为团队负责人,最应该维护哪些? 5 项核心资产

团队知识库(Team Knowledge Base)

产品文档、FAQ、流程规范、最佳实践。维护方式:建立团队文档中心,定期更新,确保所有人用同一个 Agent 时获得一致的回答。

共享技能库(Shared Skills)

团队共用的工作流封装。维护方式:把团队高频操作封装成技能(如"需求评审""设计走查""代码合并"),避免每个人重复造轮子。

工作流编排(Workflow)

跨角色、跨系统的自动化流程。维护方式:定义团队标准流程(如"需求→设计→开发→测试→发布"),让 Agent 自动串联,减少人工协调成本。

权限模型(Permission / RBAC)

谁能看什么、做什么。维护方式:按角色定义权限(如"产品经理可编辑需求,工程师可编辑代码,设计师可编辑设计稿"),确保数据隔离和操作合规。

全局指令(System Prompt)

Agent 的"宪法"。维护方式:和团队对齐 Agent 的行为基线(如"回答必须引用来源""代码必须符合 PEP8""设计必须遵循 Design Tokens"),确保多人使用时表现一致。
作为产品经理,最应该维护哪些? 6 项核心资产

项目 Brief(brief.md)

谁来用、解决啥、跟我们不一样在哪、这次不做什么。AI 从这页知道方向边界。不用写 PRD——一页纸就够。

项目上下文(AGENTS.md)

典型用户是谁、在什么场景下用、业务里常用的词。放进项目文件,AI 每次打开自动加载,不用反复解释。

功能规格(specs/*.md)

一句话说清这个功能、甩几张参考截图、标几条"绝对不能做"的事。PM 不用画 UI——AI 自己搞定交互方案。

异常场景(同 spec)

搜不到怎么提示?断网了显示什么?数据为空呢?每做一个功能顺手问一句"如果坏了用户看到什么"——AI 最不会主动考虑这些。

验收清单(checklist/*.md)

打开哪、点哪、看到什么算过关。做完一条打一个勾。这页就是进度的全部真相——不用管什么 Story Point 和燃尽图。

发布判定

AI 说"做完了"不等于做完了。PM 打开看:能用就过;不太对就截个图让 AI 改;完全不是你要的就打回去、把话说更清楚。

评测 / 基准线 / 迭代 / 标杆

给 AI 中台负责人和团队管理者的四张实操卡。

如何评测?

1
建评测集:从真实对话提取高频场景。初始 200-500 条。
2
定评分标准:5 分制打分。多人标注 Kappa>=0.8。
3
跑评测+出报告:回答三个问题:好了还是差了?差在哪?要回滚吗?

基准线怎么定?

不能拍脑袋。

1
摸底:当前版本跑评测集,记录实际得分。
2
对齐:和业务方确认容忍度。
3
三级线:红线/黄线/绿线。

如何迭代?

1
小步快跑:每次只改一个变量。
2
灰度发布:5%→20%→50%→100%。红线跌破立即回滚。
3
变更必记录:改了什么、为什么、影响什么。
4
定期复盘:每月评测,每季度对齐基准线。

质量标杆库

自动评分只能回答"及格了吗",标杆库回答的是另一个问题:"好"应该长什么样?把团队历史上公认的最高质量产出物归档保存,记录完整产出过程——既是新人学习的范本,也是评测标准活的参照系。

1
收集:每次里程碑评审后,把加权总分≥3.8 的产出物归档入库。不只存代码——把需求→设计→实现→评审的完整链路上传。
2
注释:每件标杆附一份简短的"为什么好"——指出本项做到位的具体点(如异常态穷举完整、Design Token 零偏差),不要泛泛的"质量高"。
3
对比:在后续评审中,当评分卡某个维度分数不足时,用标杆库里同维度的最佳案例作为对比参照——"你离 4 分的差距在这里"。
4
维护用户角色:个人 & 团队都需要维护。个人的标杆库是自身输出质量的最高水位线,团队的标杆库是所有人的共同参照。技术迭代后及时更新标杆,保持时效性。

标杆入库简表

产出物评分关键亮点(为什么好)录入人
____ /4.0__

产出物质量标准模板(评分卡)

评测基础设施回答了"跑分多少",但 PM 还需要回答另一个问题:AI 写的这个东西,到底能不能用?下面的五维评分卡把抽象判断变成可逐项打勾的分数。里程碑节点使用,不与日常三关验收重复。

五维评分卡

维度权重检查什么4 分锚定示例2 分锚定示例
代码质量25%零报错、lint 全过、复杂度 < 15构建一次通过,零 warning能跑但有 3 处 console.log 残留
UI 还原度25%对照 Design Tokens,偏差 < 3 项/屏间距/颜色/圆角全部命中 Token主色偏差 #3,两处圆角值不对
交互完整性20%空态/加载/错误/边界全有处理6 种边界态全部覆盖并可用只有 happy path,断网时白屏
安全性15%无密钥泄露、输入校验、越权检查所有外部输入有校验,无硬编码凭据调试日志打印了 API Key
一致性15%风格匹配现有代码,无突兀引入命名/缩进/组件复用与项目一致新文件使用了完全不同的缩进风格
1
评分:每维度 0-4 分。总分 = 各维度得分 x 权重之和。>= 3.5 通过2.5-3.5 修正后复评< 2.5 打回重做
2
时机:仅在里程碑节点(功能完成 / 上线前)正式评分。日常开发靠三关验收(自动检查 + 亲手试用 + 逐条打勾),评分卡是里程碑的质量审计。
3
模板:复制下方评分表,填入每个维度的得分与具体扣分原因。评分记录随项目归档,也是决策备忘(ADR)的质检附件

评分记录模板(可复制)

维度权重得分加权扣分原因
代码质量25%__ /4__
UI 还原度25%__ /4__
交互完整性20%__ /4__
安全性15%__ /4__
一致性15%__ /4__
加权总分__ /4.0 · 结论:通过 / 修正后复评 / 打回 · 评阅人:__ · 日期:__
总结:部署一个 AI Agent 本质上是管理 8 大类 33 项资产。每项资产都有 Owner、Consumer 和 Verifier。个人关注"好不好用",团队关注"一不一致",运维关注"稳不稳定",迭代者关注"变好还是变差",评测者关注"拿什么证明"。
← 返回新版手册