跳转至

08 | CLIP 对比语言 - 图像预训练

234 个字 预计阅读时间 1 分钟

对比学习、模型是如何知道“狗的图片”和“狗这个字”是对应关系的、Zero-shot 迁移能力

核心思想

解决了视觉模型过度依赖人工标注标签(如 ImageNet 的千类标签)导致泛化性差的问题, 通过对比学习让模型在海量互联网“图像 - 文本”对中学习视觉概念,实现了强大的零样本(Zero-shot)迁移能力。

给图片一段文本的描述

linear probe & finetune

核心方法

图像和文本更容易对齐

代码解析

相关工作

BLIP

参考