核心 GUIDE
Multimodal Iteration
Text、Image、Audio 等不同 Modality 需要围绕 Cross-modal Meaning 与 Production Constraint 一起迭代,而不是各自生成后简单拼装。
核心心智模型
Multimodal Artifact 是一个统一 Communication System。每种 Modality 都有自己的生成约束,但整体 Quality 取决于它们是否在 Meaning、Hierarchy、Timing 与 Audience Experience 上保持一致。
为什么重要
好 Script 配上误导性 Image,仍然是坏 Lesson。Caption 可能和 Visual 冲突,Diagram 可能引入正文没解释的 Label,审美很强的 Media 也可能淹没 Instructional Point。因此 Multimodal Work 需要 Shared Brief 与 Review Loop,检查的是 Modality 之间的关系,而不是孤立批准每个 Asset。
01
从 Shared Communication Contract 开始迭代
在生成 Individual Asset 前,先定义 Learning / Product Objective、Key Claim、Audience 与 Information Hierarchy。完成第一版多模态输出后,专门 Review Alignment:Image 是否支持 Claim、Narration 是否匹配 Visible State、Critical Information 是否重复或缺失、Accessibility Alternative 是否仍能成立。只修改最弱 Relationship,而不是一次全部重生。
02
例子:Context Window 动画解释
Narration 说 Old Message 正在被 Compact,但 Animation 只是随机让 Token 消失。Cross-modal Review 会发现 Visual 表达的是 Deletion,而不是 State-preserving Compression。于是只修改动画:让 Selected Constraint 与 Evidence 进入更小 Representation,Script 不需要重写。
常见失败模式
- 分别 Review Text、Image、Audio Quality,却不检查 Semantic Alignment。
- Decorative Media 抢走 Information Hierarchy。
- 一个 Modality 不匹配就把所有 Asset 全部重生,丢掉已经正确的工作。
工程启发
- 所有 Modality 共用同一 Objective、Claim 与 Audience Constraint。
- Polish Style 前先显式检查 Cross-modal Contradiction。
- Iteration 优先修改最小 Failing Relationship。
关键结论
- 01Multimodal Quality 是关系质量,不是各 Asset Score 相加。
- 02Shared Brief 能跨 Media 保持 Meaning。
- 03Iteration 既要修 Local Defect,也要修 Modality 之间的 Mismatch。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。