阿里通义千问发布最强视觉理解模型Qwen2-VL-72B!可理解20分钟以上长视频
⭐发布日期:2024年10月09日 | 来源:果姨妈育儿
【澳彩全年历史图片库】 |
【澳门现场直播网站视频在线观看免费】 |
【澳门传真资料查询图片177期大全】 | 【刘伯温结果王中王w】 | 【香港最快现场直播+结果下载澳门】 | 【澳门天天彩历史记录查询网站】 | 【新澳门今晚结果号码是多少2024】 | 【香港澳门号码2023年结果查询表】 | 【澳门现场记录2021年8月】 | 【澳门天天彩全年记录表图片及价格查询】 |
【澳门49选7走势】 | 【澳门现场结果记录】 | 【澳门网址888】 | 【澳门六叔可靠吗?】 | 【澳天天彩平特藏宝图期期精准】 | 【新澳门结果2023记录图片下载安】 | 【澳门彩记录2020年历史数据】 | 【4949澳门现场+直播天天】 |
快科技8月30日消息,阿里通义千问发布第二代视觉语言模型Qwen2-VL。其中,旗舰模型Qwen2-VL-72B的API已上线阿里云百炼平台。
据了解,Qwen2-VL在多个权威测评中刷新了多模态模型的最佳成绩,在部分指标上甚至超越了GPT-4o和Claude3.5-Sonnet等闭源模型。
2023年8月,通义千问开源第一代视觉语言理解模型Qwen-VL,成为开源社区最受欢迎的多模态模型之一。
短短一年内,模型下载量突破1000万次。目前,多模态模型在手机、车端等各类视觉识别场景的落地正在加速,开发者和应用企业也格外关注Qwen-VL的升级迭代。
相比上代模型,Qwen2-VL的基础性能全面提升。可以读懂不同分辨率和不同长宽比的图片,在MathVista、DocVQA、RealWorldQA、MTVQA等基准测试创下全球领先的表现。
此外,Qwen2-VL可以理解20分钟以上长视频,支持基于视频的问答、对话和内容创作等应用。同时,具备强大的视觉智能体能力,可自主操作手机和机器人,借助复杂推理和决策的能力,Qwen2-VL可以集成到手机、机器人等设备,根据视觉环境和文字指令进行自动操作。
该模型还能理解图像视频中的多语言文本,包括中文、英文,大多数欧洲语言,日语、韩语、阿拉伯语、越南语等。
通义千问团队从六个方面评估了模型能力,包括综合的大学题目、数学能力、文档表格多语言文字图像的理解、通用场景问答、视频理解、Agent 能力。
Qwen2-VL-72B 在大部分的指标上都达到了最优,甚至超过了 GPT-4o 和 Claude3.5-Sonnet 等闭源模型,在文档理解方面优势尤其明显,仅在综合的大学题目方面与GPT-4o 存在差距。
用户可通过阿里云百炼平台调用Qwen2-VL-72B的API:https://help.aliyun.com/zh/model-studio/developer-reference/qwen-vl-api
责任编辑:
【2024澳门天天开好彩大全免费】 【新澳天天开奖资料大全最新】 |
【2024年天天开好彩资料】 【新澳天天开奖资料大全最新54期】 |
【2024澳门天天开好彩大全53期】 【澳门天天开彩期期精准】 |
【2024全年资料免费大全】 【新澳天天开奖资料大全】 |
【澳门内部最精准免费资料】 【2024澳门天天开好彩大全】 |
【2024年新奥门天天开彩免费资料】 【新澳2024今晚开奖资料】 【下载澳门天天彩】 |
发表评论
朱智勋
4秒前:可以读懂不同分辨率和不同长宽比的图片,在MathVista、DocVQA、RealWorldQA、MTVQA等基准测试创下全球领先的表现。
IP:63.64.4.*
Micucci
3秒前:同时,具备强大的视觉智能体能力,可自主操作手机和机器人,借助复杂推理和决策的能力,Qwen2-VL可以集成到手机、机器人等设备,根据视觉环境和文字指令进行自动操作。
IP:50.81.3.*
田村高广
7秒前:快科技8月30日消息,阿里通义千问发布第二代视觉语言模型Qwen2-VL。
IP:32.62.7.*