腾讯混元大模型正式上线视频生成能力并宣布开源该视频生成大模型_腾讯控股(hk00700)股吧

股吧首页 > 腾讯控股吧 > 正文

最近访问：

腾讯控股吧

返回腾讯控股吧>>

- 重要股东股权质押数据全览

腾讯控股资讯

发表于 2024-12-03 23:16:30 股吧网页版

腾讯混元大模型正式上线视频生成能力并宣布开源该视频生成大模型

来源：中国证券报

　　12月3日下午，腾讯混元大模型正式上线视频生成能力，这是继文生文、文生图、3D生成之后，混元大模型又一进展。同时，腾讯宣布开源该视频生成大模型，参数量130亿。

　　开放申请测试

　　“用户只需要输入一段描述，即可生成视频。”腾讯混元相关负责人透露，目前生成视频支持中英文双语输入、多种视频尺寸以及多种视频清晰度。该模型已上线腾讯元宝APP，用户可在AI应用中的“AI视频”板块申请试用。企业客户通过腾讯云提供服务接入，目前API同步开放内测申请。

　　记者看到，在现场演示环节，演示视频中出现的冲浪、跳舞等大幅度运动画面，运动镜头及人物未发生形变。

由腾讯混元大模型生成的视频画面效果，来源：腾讯

　　腾讯混元相关负责人介绍，腾讯混元生成视频大模型可实现超写实画质、生成高度符合提示词的视频画面，画面流畅不易变形。光影反射基本符合物理规律，在镜面或者照镜子场景中，可以做到镜面内外动作一致。同时，模型还可以实现在画面主角保持不变的情况下自动切镜头。

　　全面开源

　　据了解，腾讯混元生成视频大模型基于DiT架构，并在架构设计上进行多处升级。混元视频生成模型适配了新一代文本编码器提升语义遵循，其具备语义跟随能力，更好地应对多个主体描绘，实现更加细致的指令和画面呈现。同时，采用统一的全注意力机制，使得每帧视频的衔接更为流畅，并能实现主体一致的多视角镜头切换；通过先进的图像视频混合VAE（3D 变分编码器），让模型在细节表现有明显提升，特别是小人脸、高速镜头等场景。

　　目前，腾讯宣布开源该视频生成大模型已在 Hugging Face 平台及 Github 上发布，包含模型权重、推理代码、模型算法等完整模型，可供企业与个人开发者免费使用和开发生态插件。基于腾讯混元的开源模型，开发者及企业无需从头训练，即可直接用于推理，并可基于腾讯混元系列打造专属应用及服务，能够节约大量人力及算力，加速行业创新步伐。

　　从年初以来，腾讯混元系列模型的开源速度不断加快。此前，腾讯混元已经开源了旗下文生文、文生图和3D生成大模型。至此，腾讯混元系列大模型已实现全面开源。

（文章来源：中国证券报） [点击查看原文]

郑重声明：用户在财富号/股吧/博客等社区发表的所有信息（包括但不限于文字、视频、音频、数据及图表）仅代表个人观点，与本网站立场无关，不对您构成任何投资建议，据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容，远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息，谨防上当受骗！

评论该主题

帖子不见了！怎么办？

作者：您目前是匿名发表登录 | 5秒注册作者：，欢迎留言退出发表新主题

郑重声明：用户在社区发表的所有资料、言论等仅代表个人观点，与本网站立场无关，不对您构成任何投资建议。用户应基于自己的独立判断，自行决定证券投资并承担相应风险。《东方财富社区管理规定》