HuggingFace镜像
/
Mage-VL
like
0
加入合集
图文转文本生成
Transformers
Safetensors
Apache License 2.0
multimodal
video-understanding
streaming
mage-vl
vision-language-model
arxiv:2607.2490
模型介绍
文件和版本
分析
下载
Notebook 快速开发
项目文件预览 - Mage-VL:可用于图像和视频理解及实时流式感知。是一个编解码器原生、主动流式的多模态基础模型,视觉编码器从零训练,通过编解码器对齐的稀疏性减少视觉令牌,实现推理加速,支持主动流式处理。【此简介由AI生成】 - AtomGit AI社区