CLIP简要概述

·

By

·

2–3 分钟

to read

clip

经典图文预训练模型

text-image:

核心思路是将图文输入分别送入双编码器(Dual Encoder),提取出多模态特征(Embeddings),然后在共享的向量空间中进行余弦相似度比较,采用了对比学习。

CLIP在计算相似度矩阵后(形状为 [batch_size, batch_size]),会同时计算两个方向的损失:

  • 行方向:对每张图片,找出它最匹配的那句文本(Image → Text)
  • 列方向:对每段文本,找出它最匹配的那张图片(Text → Image)
零样本推理(Zero-shot)

训练完成后,在做分类任务时,它不需要像传统模型那样训练一个分类头。它会把类别标签(如“狗”、“猫”、“汽车”)通过提示工程(Prompt Engineering),改造成“a photo of a {class}”这样的句子,然后分别计算图片向量与这些句子向量的余弦相似度,相似度最高的那个类别就是预测结果。

局限性:
  • 训练难度大,单个实验周期极长,调参和试错的空间非常有限(4亿图文对)
  • CLIP学的是语义级的图像-文本对齐,在需要精细感知或推理的任务上很差
  • CLIP的双流设计仅在损失层面对图像和文本整体进行全局匹配
  • 不理解文本内部的语义结构,仅仅把文本当做语义向量使用

Categories:

Keep Reading