跳转至

02 | PreTrain

227 个字 预计阅读时间 1 分钟

目标

  • 学到通用表征,再迁移到下游任务
  • 降低下游标注数据依赖

语言预训练(LLM)

  • next-token prediction:给定上下文预测下一个 token
  • 核心能力来源:大规模数据 + 大模型容量 + 稳定优化
  • 关键问题:数据噪声、重复语料、分布偏移

视觉预训练(ViT)

  • 图像切成 patch,映射为视觉 token
  • 加位置编码后进入 Transformer
  • 产出全局语义表征,用于分类 / 检索 / 对齐

跨模态预训练(VLM)

  • 对比目标:拉近匹配图文,拉远不匹配图文
  • 生成目标:根据图像生成文本或根据文本生成描述
  • 常见组合:视觉编码器 + 语言模型 + 连接层

数据与训练要点

  • 数据质量优先于盲目扩量
  • 去重与过滤决定训练上限
  • 训练、验证、测试必须严格隔离