讨论列表 - clip-vit-base-patch32:可用于实现零样本图像分类等任务,通过自然语言指令预测图像相关文本。项目提供完整迁移指导,支持图像与文本特征编码及相似度计算,核心模型为 ViT-B/32。【此简介由AI生成】 - AtomGit AI社区