模块一:从“测试”到“评测”(9:00-10:00)
1.1传统软件测试与AI系统测试的本质差异
1.1.1确定性输出 VS 非确定性输出
1.1.2规则驱动VS 数据驱动
1.1.3功能验证VS 能力评估
1.2Test4AI的概念内涵与边界
1.2.1Test4AI vs. AI4Test的区别与联系
1.2.2Test4AI的覆盖范围:LLM评测、Agent测试、AI安全性测试等
1.3AI评测的核心思维转变
1.3.1从“对错判断”到“质量度量”
1.3.2从“用例执行”到“能力评估”
1.3.3从“缺陷发现”到“风险识别”
1.4实战案例引入:以一个传统测试用例与AI评测场景的对比演示开场,引导学员理解范式转变的必要性。
模块二:模型评测的技术概览(10:00-11:00)
2.1 大模型评测的产业背景与标准体系
2.1.1GB/T 45288.2-2025《人工智能 大模型 第2部分:评测指标与方法》
2.1.2中国信通院“方升”大模型基准测试体系
2.1.3ISO/IEC 42119系列AI测试标准
2.2评测的核心要素框架:测试维度、测试数据集、测试方法、测试工具
2.3主流模型评测基准介绍
2.3.1常识推理:MMLU
2.3.2数学推理:GSM8K
2.3.3代码能力:HumanEval
2.3.4多模态评测基准
2.4实战案例分享:分析某企业在大模型选型中如何利用标准评测基准进行模型对比。
模块三:模型评测的基本方法(11:00-12:00)
3.1客观评测方法——基于标准数据集的自动化评测(精确匹配与模糊匹配)
3.2主观评测方法——人工评估流程与规范、评分卡设计与校准
3.3LLM-as-a-Judge方法——原理、适用场景、优势与局限性
(14:00-14:30)
3.4多维评估方法——任务准确性、鲁棒性、可解释性、效率、偏见消除
3.5实战演练:学员分组针对给定的模型输出进行人工评分,体验主观评测的校准过程。
模块四:AI原生应用评测的技术概览(14:30-15:00)
4.1 AI原生应用的定义与特征——与传统应用的本质区别(输出不确定性、交互依赖上下文)
4.2 AI原生应用评测的技术挑战——流量分配复杂性、指标选择敏感性、迭代周期压缩性
4.3 评测技术栈全景——数据层、模型层、应用层、用户层的评测技术
4.4 实战案例:以智能客服系统为例,简要分析其评测技术选型思路。
模块五:AI原生应用评测的基本方法(15:00-17:00)——核心模块,含实战
5.1测评理论与工具方法:A/B测试在AI场景的进阶实践、分层流量控制与数据隔离
5.2输出结果的评估方法和维度
5.2.1基础可用性指标:任务完成率、响应时间、错误率
5.2.2AI特性指标:生成质量(BLEU、CLIP评分)、交互深度、用户信任度
5.3测试数据集构建:“从真实场景回推数据”的策略、“先质后量”的平衡策略与黄金数据集、标准化数据生产流程
5.4不同智能体测评方法的侧重点
 5.4.1;分析型智能体:逻辑推理与结论准确性
 5.4.2预测型智能体:预测准确率与置信度校准
 5.4.3;决策型智能体:决策质量与可解释性
 5.4.4生成型智能体:内容质量、多样性、安全性
 5.4.5多智能体联合场景的端到端测试:多智能体协作的评估维度、端到端评估流水线、多智能体辩论框架与投票协议
5.5智能体接口测试:工具调用能力的量化评测、API接口的功能/性能/安全测试
5.6典型案例实战讲解:以多智能体客服系统为例,现场演示端到端测试方案的设计与执行全过程。
模块六:AI原生应用评测的“可验证性”与“公平性”理论(9:00-10:00)
6.1可验证性理论:评测结果的可重复性与可追溯性、基于区块链的透明评测协议、基准数据污染问题与应对
6.2公平性理论:公平性的定义与度量维度、不同用户群体的公平性差异分析、自动化公平性测试方法
6.3工程实践:评测流程的标准化与审计、公平性评估框架落地
6.4实战研讨:围绕一个存在公平性争议的AI应用案例,分组讨论如何设计可验证的公平性评测方案。
模块七:AI原生应用评测的特殊性与难点(10:00-10:30)
7.1非确定性的根本挑战——相同输入不同输出的评测困境、概率性输出的质量度量
7.2评测的“拟人化”挑战——主观质量难以量化、语境依赖与长尾场景
7.3数据与基准的局限性——静态基准与动态能力的脱节、数据污染与过拟合风险
7.4评测成本与效率的平衡
7.5实战案例:分享某团队在AI应用评测中遇到的典型困难及解决思路。
模块八:区分模型能力和Agent能力(10:30-11:30)
8.1模型能力(Model Capability):基础语言理解、指令遵循、静态任务解决;典型评测基准(MMLU、GSM8K、HumanEval)
8.2Agent能力(Agent Capability):自主性、推理、工具使用、环境交互、记忆与上下文保持、多智能体协作
8.3本质区别:模型基准测试衡量“知道什么”,Agent评估衡量“能做什么”(类比:学校考试 vs. 工作绩效评审)
8.4分层评估框架:最终输出层、推理层、工具层、记忆层的分层评估策略
8.5实战演练:给定一个Agent应用场景,学员现场识别并区分哪些属于模型能力评测、哪些属于Agent能力评测。
模块九:AI原生应用评测的完整流程(11:30-14:30)
9.1评测全流程概览:需求分析→评测设计→数据准备→执行评测→结果分析→持续监控
9.2各阶段的关键活动与产出物
9.3评测流程的闭环机制——“测试-反馈-优化”循环
(14:00-14:30)
9.4评测左移与全流程嵌入策略
9.5实战案例:以一个真实的AI原生应用项目为例,完整演示评测流程各阶段的实操要点。
模块十:AI原生应用评测的数据集准备(14:30-15:15)
10.1数据集的需求分析——评测目标驱动的数据规划、场景覆盖度与代表性
10.2数据集的构建方法——真实数据采集与标注、合成数据生成、公开数据筛选与适配
10.3数据集的质量保障——多轮质检流程、偏差检测与修正
10.4数据集的版本管理与持续更新
10.5实战演练:针对一个指定的评测场景,现场快速设计数据集构建方案框架。
模块十一:AI原生应用质量全生命周期的扩展(15:15-15:45)
11.1从测试到全生命周期质量保障——设计阶段的质量前置、开发阶段的持续评测、部署后的生产监控
11.2分层测试策略——数据质量与偏见测试、模型能力测试、系统集成测试、生产环境持续监控
11.3质量保障的扩展维度——安全性、可靠性、可解释性、合规性
11.4组织级质量体系的构建思路
11.5实战案例:分享某企业AI应用全生命周期质量保障体系的建设经验。
模块十二:AI原生应用评测的业界前沿实践(15:45-16:30)
12.1自动化评测框架——LaQual(LLM应用自动化质量评估)、VIBE(容器化沙盒分层评估)
12.2智能化测试平台实践——AI多智能体协作的测试平台、自然语言驱动的测试自动化
12.3行业标杆案例——金融行业AI测试实践、电商行业全流程自动化测试
12.4效率提升数据与ROI分析
12.5案例研讨:深度分析2-3个行业标杆案例,分组提炼可复用的实践模式并进行汇报。
模块十三:AI原生应用评测的发展方向 + 课程总结与Q&A(16:30-17:00)
13.1从静态基准到动态自适应评测的演进趋势
13.2Agent-as-a-Judge的兴起与演进
13.4多智能体协作评测框架的探索
13,5可解释性评测与透明度要求的提升
13.6评测的标准化与生态化趋势
模块十四:课程总结与Q&A
14.1两天课程核心内容回顾(以思维导图形式呈现)
14.2学员疑问集中解答
14.3后续学习路径与资源推荐
【投稿】【关闭窗口】【打印】