先建立心智模型
从三个基础实验开始
一次只改变一个变量,观察系统如何响应,再把结果还原成一个可以用于工程判断的因果关系。
0/3
本机学习进度
只保存在当前浏览器,不需要账号。
主动把系统弄坏
生产级失败实验
从一个明确的失败状态开始。调整工程策略、与基线比较,然后看清:一个指标变好时,系统究竟付出了什么代价。
新调试指令契约 →可用破坏并调试 RAG →可用压缩工作上下文 →可用调整 Agent 策略 →可用调试发布决策 →
Production Lab · Prompt
¶
指令冲突实验
先修正指令权威关系,再看为什么 Prompt 仍然无法替代真实的运行时安全机制。
调整权威 · 明确度 · 上下文角色 · Schema · 歧义
理解Prompt → Context → Harness → Evaluation 的责任边界
Production Lab · Context
⌕
RAG 失败实验
修复检索问题,同时验证“给模型更多上下文”为什么并不总是更好。
调整Chunk · Top-K · Hybrid · Reranker
观察召回 · 精度 · 上下文压力 · 质量 · 成本
Production Lab · Context
▱
上下文压缩实验
减少 Token 的同时,别把真正会改变答案的信息一起压掉。
调整压缩 · 摘要 · 检索 · 记忆 · 关键信息保护
观察信息保留 · 任务质量 · 幻觉风险 · 延迟 · 成本
Production Lab · Harness
⌘
Agent 可靠性实验
提高可靠性,同时正视重试、校验、审批和运行约束本身也有成本。
调整步数 · 重试 · 超时 · 结果校验 · 人工审批
观察成功率 · 失控风险 · 安全 · 延迟 · 成本
Production Lab · Evaluation
✓
评测失败实验
在整体分数变好的情况下,找出那个足以阻止发布的隐藏回归。
调整数据集 · 阈值 · 安全否决 · 样本 · Judge · 成本
决定SHIP · BLOCK · INCONCLUSIVE
学习方式
SEE → PLAY → BREAK → AHA → BUILD
01
SEE
先把原本看不见的系统状态呈现出来。
02
PLAY
改变一个参数,观察结果如何变化,而不是背术语。
03
BREAK
主动触发失败,让隐藏假设暴露出来。
04
AHA
把原因、结果和工程边界连起来,形成可复用的理解。
05
BUILD
把这个心智模型带回架构、调试、评测与发布决策。
AhaFrame AI 工程栈
生产 AI 系统背后的六类工程责任
它们不是框架名,而是六个不同的责任边界。先判断问题属于哪一层,再决定该在哪里修。
01Prompt 工程行为 · 指令权威
02上下文工程知识 · 检索 · 压缩
03Harness 工程可靠性 · 工具 · 权限
04Loop 工程迭代 · 恢复 · 终止
05Graph 工程编排 · 分支 · 汇合
06评测工程证据 · 发布决策
从“会用 AI”走向“会构建 AI 系统”。
加入内测,第一时间体验新的失败模拟与生产实验。