AI agent 评测与基准测试 SOP:怎么科学衡量一个 agent
AI agent 评测与基准测试 SOP:四类指标(成功率/效率/安全越狱/鲁棒性)、搭 eval 集(典型/边界/对抗 60:25:15、程序化评分优先)、多轮采样+基线对照、记录 latency/cost。引用本站 V4-Flash 实测 harness 方法。
首页
场景化落地教程,含真实截图、Prompt、工作流模板与踩坑记录。
AI agent 评测与基准测试 SOP:四类指标(成功率/效率/安全越狱/鲁棒性)、搭 eval 集(典型/边界/对抗 60:25:15、程序化评分优先)、多轮采样+基线对照、记录 latency/cost。引用本站 V4-Flash 实测 harness 方法。
spec 驱动开发实战 SOP:动手写代码前先把需求落成 spec(问题/目标/边界/验收),再分块确认、生成实现计划、拆任务、实现与验证、对照 spec 验收。附 spec 模板代码块与 github/spec-kit 脚手架配合。
Bug 分流自动化 n8n 工作流:Webhook 接收 bug 报告->提取字段->LLM 分类(严重级 P0-P3+模块+复现)->IF P0/P1 紧急通知值班+建高优 issue,否则按模块路由->自动回复提交者。配 .json 模板。
AI 内容日历自动化 n8n 工作流:定时采集选题->LLM 打分+建议发布日期+栏目->写入日历(飞书/Notion)->临近发布通知负责人->状态回写。配 .json 模板下载。
通用编码 Prompt 包三级:入门按需求生成函数、进阶重构与优化、专家系统设计与多文件脚手架。附速查 prompt。全嵌约束(可运行+边界+不臆造 API+需人审)。与代码审查调试包差异化。
金融分析 Prompt 包三级:入门财报三表速读、进阶估值与同业对比(DCF/倍数法)、专家风险拆解与投资逻辑。全嵌反编造约束(数据须核验权威源)+ 合规声明(非投资建议)。
RAG 分块策略 SOP:固定/递归/语义/结构感知四种策略,chunk_size 与 overlap 调参经验,父子分块与 late chunking,召回评测迭代。附 LangChain 分块器代码示例。
LLM 微调实战 SOP:LoRA/QLoRA 全流程。何时微调 vs RAG vs prompt、数据准备(指令格式)、基座选型、QLoRA 4-bit 量化加载、训练配置、评估、合并部署。附 peft/transformers 代码示例。
用 LangGraph 1.2 搭建生产级 Agent 的完整 SOP:从 typed state 与 checkpointer 持久化、per-node timeout 防卡死,到 RetryPolicy 重试、error_handler 兜底、interrupt 人工审批。附完整 Python 代码、参数速查表与踩坑记录。
这套 n8n 工作流把会议纪要端到端自动化:录音上传后调 Whisper 转写,大模型抽取议题/决议/待办,再分发飞书群、邮件和 Notion。区别于「会议纪要 Prompt 包」只处理文本到纪要,本篇是无人值守流水线,30 分钟会议从上传到纪要进群可压到 3 分钟。