Video-LLaMA:一种用于视频的指令调谐视听语言模型-品玩

Video-LLaMA:一种用于视频的指令调谐视听语言模型

2023年6月6日

品玩6月6日讯，阿里巴巴集团达摩院研究人员提出一种多模态框架：Video-LLaMA，，使语言模型能够理解视频中的视听内容。通过跨模态训练，解决了视频难以理解的挑战，包括捕捉时间变化和整合音视频信号。研究表明Video-LLaMA能够感知和理解视频内容，并生成基于视听信息的有意义回答。该研究为开发音视频AI助手提供了潜在的原型。已提供代码、预训练模型和演示。

点赞

下载品玩App，比99.9%的人更先知道关于「Video-LLaMA」的新故事

下载品玩App

比99.9%的人更先知道关于「Video-LLaMA」的新故事

iOS版本 Android版本

AI阅读助手

以下有两点提示，请您注意：
1. 请避免输入违反公序良俗、不安全或敏感的内容，模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务，但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时，您需要自行判断并承担风险；
感谢您的理解与配合

该功能目前正处于内测阶段，尚未对所有用户开放。如果您想快人一步体验产品的新功能，欢迎点击下面的按钮申请参与内测申请内测