通义千问开源视觉语言模型Qwen2-VL 2B、7B尺寸API可直接调用-品玩

品玩9月2日讯，通义千问宣布开源其第二代视觉语言模型Qwen2-VL，并在阿里云百炼平台上推出2B、7B两个尺寸及其量化版本模型的API，供用户直接调用。

Qwen2-VL模型在多个方面实现了性能的全面提升。它能够理解不同分辨率和不同长宽比的图片，在DocVQA、RealWorldQA、MTVQA等基准测试中创下全球领先的表现。此外，该模型还能理解20分钟以上的长视频，支持基于视频的问答、对话和内容创作等应用。Qwen2-VL还具备强大的视觉智能体能力，能够自主操作手机和机器人，进行复杂推理和决策。

该模型能够理解图像视频中的多语言文本，包括中文、英文、大多数欧洲语言、日语、韩语、阿拉伯语、越南语等。通义千问团队从六个方面评估了模型的能力，包括综合的大学题目、数学能力、文档表格多语言文字图像的理解、通用场景问答、视频理解、Agent能力。