跳转至

07 | ViT 视觉 Transformer

198 个字 预计阅读时间 1 分钟

核心思想

Transformer NLP 扩展的很好,越大的模型就会产出越好的效果,一直上升 如何把 NLP 当中的技术用到 CV 当中来呢

  • 直接用像素点的话,序列长度太长
  • 控制窗口大小,控制长度;轴注意力

用标准 Transformer 来做,但是图片的序列长度太长,所以需要把图片分成 patch,然后做自注意力。

提出了一个新模型的任务,用在图像分类任务。

ViT 之上,

难点

相关工作

代码解析

对于 ViT 的改进

参考