# ModelDiff · 交付说明

打开 index.html 即可使用，无需安装。顶部“设计案例”查看完整叙事，“交互原型”进入结果总览。

## 建议体验路径

1. 在行为地形图点击退款争议。
2. 打开 MD-014，对比模型输出与工具调用；尝试切换重复轮次。
3. 输入审核人和理由，保存复核。注意阻断仍然存在。
4. 打开发布决定，选择修复重评，填写负责人和条件并保存。
5. 在版本总览导出决策；在测试集管理回流新失败到 v1.5 草稿。

## 范围

11 个功能界面、完整作品集叙事、24 个虚构测试案例，以及 MD-025 回流草稿。冻结实验 EXP-024 有 22 个可比案例：一个候选超时、一个敏感样本隔离；它们不计零分。5 个关键案例持续阻断发布。

所有评测、成本和运行数据均为设计演示。质量为案例级示例分数的平均，不宣称真实模型性能或统计显著性。额外行为指标是独立标注的虚构汇总。地图的区域位置、高低、大小是描述性导航，没有人口或置信区间含义。

复核和决定保存在当前浏览器 localStorage，支持 JSON 导出。不是多人协同数据库，也不提供真实审批身份验证。草稿配置可以保存，但不会触发真实模型调用或改变冻结结果。运行进度是定时模拟。工具调用和引用是虚构证据。例外申请只留痕，不执行发布。

## 设计规则

- 硬性风险 > 信息缺失或规则冲突 > 灰度限制 > 监控提示。
- 人工审核完成不自动解除已确认缺陷；解除需要修复与新实验。
- 颜色同时配合状态文字和地图纹理；支持键盘焦点与减少动态效果。
- 语义标注是人工编写的演示片段，不是假装运行的 NLP 算法。
- 同步滚动可以关闭；小屏地图保留完整区域并允许横向浏览。

## 研究证据与计划

仅有用户简报和公开文档研究，没有完成用户访谈或实际可用性测试。LangSmith 官方文档 https://docs.langchain.com/langsmith/evaluation 支持离线与线上评测、人工/代码/模型评审、重复实验和失败回流。用户提供的 OpenAI Evals API 链接本次抓取失败，因此未产生新的验证结论。

待验证：邀请 AI 产品经理、工程师、内容安全三类用户，每类至少两名；五分钟内发现关键退化、区分证据来源并给出可解释决定。比较地形与切片表的识别时间和漏判率。不能把本地功能检查写成用户研究成果。

## 字体与资产

IBM Plex Sans：SIL Open Font License；中文使用系统 PingFang SC 或 Noto Sans SC 回退。地图为本项目代码生成的描述性 SVG，可编辑。界面导航采用统一线性图标。

## Figma

云端写入连续失败，创建的文件仍为空。替代交付在 figma-import（本地插件）与 editable-screens（SVG），详见其中 README。未宣称云端设计稿已完成。

交付状态与验证结果见 validation.md。
