08 | CLIP 对比语言 - 图像预训练 ¶
约 234 个字 预计阅读时间 1 分钟
对比学习、模型是如何知道“狗的图片”和“狗这个字”是对应关系的、Zero-shot 迁移能力
核心思想 ¶
解决了视觉模型过度依赖人工标注标签(如 ImageNet 的千类标签)导致泛化性差的问题, 通过对比学习让模型在海量互联网“图像 - 文本”对中学习视觉概念,实现了强大的零样本(Zero-shot)迁移能力。
给图片一段文本的描述
linear probe & finetune
核心方法 ¶
图像和文本更容易对齐