CLIP 图文对齐 CLIP 图文对齐 核心思想 图像编码器 文本编码器 图像;Transformer 文本 投影头、归一化 对比学习:图文对拉近、负样本推远 内负样本 大规模图文对预训练 共享语义空间、零样本迁移 embedding 空间对齐 新类别无需微调 能力 零样本分类:文本描述作为类别 以图搜图、图文相似度排序 跨模态检索、引导生成 模型与扩展 OpenAI CLIP、OpenCLIP、中文 CLIP 等多模态 作为其他模型的文本/图像编码器 应用 开放词汇检测、分割(OV-DETR、OV-SEG) 文本条件检测、无需固定类别 CLIP 特征 检测头 图文检索、推荐、内容审核 相似度排序、向量库 违规检测、标签推荐 机器人:自然语言指代物体与场景 “拿红色的杯子” 检索 场景描述、任务理解