SAM、CLIP...最近有哪些基于 RWKV 的多模态等研究?【第二期】

大家好,我们整理了近期 RWKV 生态中新增的一些多模态工作,包含:RWKV-SAM(图像分割模型)、RWKV-CLIP(视觉语言表示学习)、point-RWKV(3D 点云学习框架)……

RWKV-SAM

  • 相关论文: Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
  • 论文地址:https://arxiv.org/abs/2406.19369
  • GitHub 仓库:https://github.com/HarborYuan/ovsam

论文设计了基于 RWKV 的图像分段切割方法“RWKV-SAM”(Segment Anything Model)。

下图为 RWKV-SAM 架构:

SAM、CLIP...最近有哪些基于 RWKV 的多模态等研究?【第二期】_第1张图片

与 Transformer 模型相比,RWKV-SAM 实现了 2 倍以上的加速,且可以在各种数据集上实现更好的图像分割性能。

此外,RWKV-SAM 的分类和语义分割结果优于最新的视觉 Mamba 模型。

你可能感兴趣的:(人工智能,语言模型,AIGC,自然语言处理)