02 | PreTrain¶
约 227 个字 预计阅读时间 1 分钟
目标 ¶
- 学到通用表征,再迁移到下游任务
- 降低下游标注数据依赖
语言预训练(LLM)¶
- next-token prediction:给定上下文预测下一个 token
- 核心能力来源:大规模数据 + 大模型容量 + 稳定优化
- 关键问题:数据噪声、重复语料、分布偏移
视觉预训练(ViT)¶
- 图像切成 patch,映射为视觉 token
- 加位置编码后进入 Transformer
- 产出全局语义表征,用于分类 / 检索 / 对齐
跨模态预训练(VLM)¶
- 对比目标:拉近匹配图文,拉远不匹配图文
- 生成目标:根据图像生成文本或根据文本生成描述
- 常见组合:视觉编码器 + 语言模型 + 连接层
数据与训练要点 ¶
- 数据质量优先于盲目扩量
- 去重与过滤决定训练上限
- 训练、验证、测试必须严格隔离