≡ AI工具

PaliGemma 2 – 谷歌DeepMind推出的全新视觉语言模型

分类:AI工具
PaliGemma 2 – 谷歌DeepMind推出的全新视觉语言模型

PaliGemma 2是什么

PaliGemma 2是Google DeepMind基于Gemma 2语言模型家族推出的新一代视觉语言模型(VLM),作为PaliGemma模型的升级版。结合SigLIP-So400m视觉编码器和不同规模的Gemma 2模型,支持多种分辨率,基于多阶段训练具备广泛的知识迁移能力。PaliGemma 2在多种学术任务上表现出色,尤其在大型模型和高分辨率配置下性能显著,同时在OCR、音乐乐谱识别和医学图像报告生成等新领域也取得了突破。