智谱AI清影实测：6秒视频排队2分钟猫猫很可爱人手很翻车_视频_模子

2024-09-12 17:47:17 智能助手

作者 | 喷鼻香草编辑 | 李水青

智谱AI清影实测：6秒视频排队2分钟猫猫很可爱人手很翻车_视频_模子智能助手

全量上线，免费可用！

智东西7月26日宣布，本日一早，大模型独角兽智谱AI正式发布视频天生工具清影，可支持文生、图生6秒时长的视频，即日起在PC端、手机App端以及小程序端面向所有C端用户免费开放。

先来看看效果，以下是几个官方放出的文生和图生视频案例，覆盖人像、动物、3D卡通等场景：

从Demo来看，清影的天生效果虽然比较Sora等还有一定进步空间，但就整体而言流畅度、运动幅度等都很不错，无论是人物表情、动作，还是光影变革、镜头移动，都没有明显的卡顿和突兀感，对运动幅度的把控也恰到好处，不会看起来像PPT也不会过于夸年夜。

此外，虽然天生是完备免费的，但天生视频须要排队，智谱AI供应了两种加速排队的订阅办法，包括5元加速1天、199元加速1年。

清影API本日也同步上线，企业和开拓者都可以通过调用API的办法，体验并利用清影的文生、图生视频能力，据称这也是海内上线的首个视频天生API。

据智谱AI CEO张鹏解读，清影基于自研的底座视频天生模型CogVideoX打造，能将文本、韶光、空间三个维度领悟起来。
该模型参考Sora算法设计，采取了DiT架构，比较前代CogVideo模型推理速率提升了6倍。

智谱AI成立于2019年6月，起源于清华大学打算机系知识工程实验室，专注于开拓新一代认知智能大模型。
一贯以来，智谱AI以对标OpenAI全模型产品线为线索，陆续研发了包括文本、代码、图像、Agent等方面的自研模型和产品矩阵。
这次发布基于CogVideoX的清影，使其大模型矩阵又扩充类一个模态。

值得一提的是，这也是海内做措辞大模型起身的大模型独角兽，首次推出视频天生产品——之前这个赛道更多的是字节、快手等短视比年夜厂，以及爱诗科技、生数科技等专注于视频天生模型的创企。

清影详细有哪些特点？其底层模型在哪些方面做了创新？详细效果如何？智东西第一韶光上手实测了一番，有以下几点创造：

1、简短的提示词效果更好，繁芜指令下会丢失细节。

2、人手仍是重灾区，随意马虎涌现画面闪烁的征象。

3、天生很快，但加上排队等待韶光仍达到1-2分钟。

4、比较图生视频，文生视频的稳定性更高。

当然，有限次的体验无法做到全面，也欢迎感兴趣的读者朋友，在评论区分享体验感想熏染和新创造~

一、半分钟天生6秒视频，繁芜指令、内容连贯

清影紧张有4个特点：天生速率快、繁芜指令屈服能力强、内容连贯性高以及画面调度幅度大。

首先在天生速率上，清影AI据称可以在30秒内天生一段6秒、帧率16fps、分辨率1440960的视频。

▲实时演示视频天生（动图有加速）

其次，在繁芜指令屈服能力上，智谱AI自研了视频理解模型，用于为视频数据天生高度吻合的文本描述，进而构建了海量高质量视频文本对，提升了指令遵照度。

▲繁芜指令演示

清影的第三个特点是内容连贯性，能够比较好地还原物理天下当中的一些运动的过程。

例如基于这张大家熟习的杜甫画作，清影让杜甫不仅动了起来，而且非常自然顺滑地端起了一杯咖啡。

▲内容连贯性

末了在画面调度方面，清影采取文本、韶光、空间领悟的Diffusion Transformer架构，可天生遵照特定运动规则的动态视频。

智谱AI豪迈地放出了几十个Demo，个中不乏有一些效果惊艳，比如这个：木头上长出两朵奇特的透明塑料花。

“透明塑料花”不是真实存在的，清影的想象力和审美在这个案例中得以展现。

再比如这个：比得兔开小汽车，游走在马路上，脸上的表情充满愉快喜悦，全景画面。

清影绘制的兔子表情很丰富，没有涌现五官扭曲的情形，前后景别还加了景深处理。

人像案例清影也拿捏住了，比如这个提示词：油画风格，俏丽的少女侧颜，光透过树形成斑驳的影子，柔光落在她脸上。

全体画面光影比拟光鲜，不过遗漏了“油画”、“斑驳的影子”等细节。

二、实测上手有惊艳也有翻车，付费加速有些鸡肋

官方演示虽好，但清影到底好不好用，还是得自己试一下才能知道。
打开清影网页端，可以看到有文生、图生视频两种功能。

▲清影网页端

在文生视频中，我可以选择视频风格，包括卡通3D、黑白老照片、油画等；也可以选择情绪氛围，包括温馨和谐、生动活泼、紧张刺激、悲惨寂寞等；运镜办法包括水平、垂直、推近、拉远四种。

在图生视频中，我可以为图片添加笔墨描述，如果不知道写什么也可以空着，或是让系统随机天生一个提示词。

▲两种模式

首先我考试测验了一组动物场景的提示词，第一个为：一只蓝猫在猫爬架上，正在吃主人递过来的芝士汉堡，情绪氛围选择了温馨和谐。

可以看到，清影准确理解了提示词，整体效果还是很不错的。
对付提示词中细节，包括猫的品种、汉堡的种类以及“递过来”的动作等，都表达得比较精准，人手也没有翻车。

第二个提示词为：一只橘猫把鼠标推下桌子，情绪氛围为生动活泼。

这次清影表现得一样平常，鼠标上莫名其妙拴了一只小老鼠就算了，“推下桌子”的动作也是完备没有表示。

前两个提示词都属于写实场景，第三个提示词则有些“魔幻现实”：一只白猫在车里驾驶，穿过繁忙的市区街道，背景是高楼和行人，情绪氛围为紧张刺激。

清影对付这个提示词的理解和呈现都还比较准确，背景中动态场景的运动幅度、同等性也比较高，但是稳定性还有所欠缺，画面会涌现抖动的情形。

第二组提示词我考试测验了人物场景。
首先来试试经典的吃面：一个男人坐在桌边吃面条，情绪氛围为悲惨寂寞。

在这个经典难题上，清影的表现还算可以，乍一看没什么缺点。
但细看之下，男人吃面的餐具用的是勺子，面条的形态也有些僵硬。

第二个提示词是：一个女孩坐在米色沙发上，专心地用钩针勾着一顶浅蓝色帽子，情绪氛围为温馨和谐。

这条提示词中我加入了色彩的细节，清影都准确地表现了出来。
女孩的钩织动作也比较真实，便是人手非常“鬼畜”。

第三个提示词为：俊秀的水色瞳孔特写，写实风格，超清，情绪氛围为悲惨寂寞。

清影天生的视频基本上知足了我的预期，不过在特写镜头下，人物的皮肤和毛发都显得有些“油腻”。

末了我考试测验了让清影自己天生提示词，它直接整了这么长一段：雨天的咖啡馆，以窗户为媒介拍摄一个英式咖啡馆内部，要清晰的拍摄咖啡馆内部，捕捉咖啡馆内的温馨氛围，然后变焦，对焦在雨滴拍打的窗户上。
细节上，把稳捕捉顾客们的交谈和笑颜，以及雨水在窗户上形成的光影效果，营造出舒适而宁静的氛围。

结果很遗憾，清影自己给自己挖了个坑，天生的不能说是视频，称之为动图都有些难堪。
画面仅仅是平移放大了一圈，也没能表示提示词中的大部分内容。

体验完文生视频后，我又考试测验了图生视频。

首先在上传图片时，清影会提醒我对图片进行裁切，且只能裁成进行固定比例的横图，这就造成了一定的局限性。
上传图片之后，我输入提示词：花瓣在风中摇动。

天生效果还是比较准确的，不过这个提示词本身的难度也不算大。

接着我上传了一张静物图，这次没有输入提示词，看看清影会如何自由发挥。

这张图上有很多独立的物体，清影并没有让它们整体运动而是为每个“小团子”添加了不同动态，整体画面比较生动活泼。

第三张图我上传了一张戴着墨镜的人像，提示词为：男孩把墨镜摘下来。

这个提示词的难度很大，而且涉及到“无中生有”的部分。
清影成功表现了“摘墨镜”这一动作，不过摘了是摘了，但没完备摘，墨镜还在人脸上挂着，视频后半段还涌现了人体不自然的扭曲。

如果不哀求它凭空天生人脸又会如何？我有上传了一张举着摄像机的人像照片，提示词改为：男孩转身面向镜头。

结果这次清影反而整了个人脸出来，便是没有眼白有些吓人……不过忽略脸的话，这次天生的效果转身幅度更大，人物的头发也随风飞舞，便是他手中的器材变了个样子容貌，人手也有些不自然。

一番体验下来，清影天生视频的效果有的惊艳到我，比如第一个小猫吃汉堡的例子，笔墨理解十分准确；也有的翻车严重，比如咖啡厅、橘猫的例子中，失落误都比较大。

整体来看，清影在天生速率上确实比较快，虽然较宣扬的30秒还有些偏差，但差不多1分钟旁边就能天生视频；在运动幅度、语义理解等方面，会比较看运气，不过这也是所有视频天生工具的通病。
与市情上其他公开可用的工具比较，清影在天生时长、清晰度方面还有一定的进步空间，不支持画面比例的选择也是一大遗憾。

值得一提的是，清影目前的视频天生是完备免费的，不须要会员订阅也没有数量限定。
不过在排队天生的过程中，清影提醒我可以加速。
点击加速的按钮，可以看到它供应了两种订阅办法：5块钱加速1天，或是199元加速1年。

▲加速排队

该说不说，这个价格还是很实惠的，但为啥我加完速排队韶光一点也没减少呢……唯一的变革便是，从“排队中”变成了“加速排队中”。
可能用度太便宜了，大家都加速就相称于没加速吧（doge）。

三、自研端到端视频模型，首个API同步上线

清影基于智谱AI自研的底层模型CogVideoX打造，具有内容连贯、可控性高档特点。

在内容连贯性方面，智谱AI自研了一个高效的三维变分自编码器构造，称之为3D VAE。
它能够将原视频空间压缩至2%的大小，大大减少视频扩散天生模型的演习本钱和难度，再合营3D RoPE（旋转位置编码）模块，有利于在韶光维度上捕捉帧间关系，建立食品中的长程依赖。

在可控性方面，智谱AI自研了一个端到真个视频理解模型，用于为海量的视频数据天生详细的、贴合内容的描述文本，从而增强模型的文本理解和指令遵照的能力，使天生视频更符合用户的输入，理解超长的繁芜指令。

在模型构造上，CogVideoX采取了将文本、韶光、空间三个维度全部领悟起来的Transformer架构，摒弃了传统的交叉把稳力（Cross-Attention）模块，将文本和视频两个不同模态的空间进行对齐，能够更好地进行模态交互。

▲CogVideoX特点

张鹏称，在CogVideoX的研发过程中，智谱AI有一次验证了Scaling Law在视频天生方面的有效性和可靠性，未来团队会在连续扩大数据规模和模型规模的同时，探求更具打破式创新的模型架构。

智谱AI又一次实现了对OpenAI全模型产品线的对标。

▲智谱AI对标OpenAI全模型产品线

在算力方面，清影是在北京亦庄AI公共算力平台上演习而来的。
数据层面，智谱AI与Bilibili、华策影视等进行了互助。

张鹏谈道，虽然视频天生模型才刚刚起步，但已经受到了很多家当和客户侧的需求，涉及电商产品宣扬、影视殊效等领域。

本日起，清影AI也同步在智谱AI大模型开放平台上线了API，企业和开拓者都可以通过调用API的办法体验并利用CogVideoX的文生、图生视频能力，据称这也是海内上线的首个视频天生API。

随着清影能力的加入，智谱AI旗下的AI助手清言App在功能的全面上再下一城，覆盖对话、生图、代码、Agent和视频。

智谱AI还准备了一个One more thing——视频生视频能力。
不过准确来说，这相称于是一个手动视频生视频的能力：基于智谱AI近日开源的视频理解模型CogVLM2-Video，用户可以上传视频并提取出详细的笔墨描述，再将笔墨输入清影，实现“视频生视频”的效果。

▲视频生视频

结语：又一强力玩家入局AI视频天生

Sora发布后，AI视频天生迎来“第二春”，无论是技能、产品的迭代，还是成本市场的关注，都达到了新的高度。
光是本周，就有快手宣告环球上线、爱诗科技发布第二代模型，以及本日智谱AI入局等重磅进展。
（视频天生大战2.0！
大厂狂卷底层模型，创企5个月吸金44亿）

不同于此前的文本、图像模型赛道，海内长期处于追逐OpenAI等外洋企业进展的状态。
在视频天生领域，海内的大厂、创企在短短几个月内实现弯道超车，不仅打磨出了高质量的底层模型，而且个个公开可用乃至免费，给至今仍是期货的Sora上了一课。

本文系作者个人观点，不代表本站立场，转载请注明出处！

清影视频

智谱AI清影实测：6秒视频排队2分钟猫猫很可爱人手很翻车_视频_模子

热门内容

随机文章

推荐内容

最新内容

TAGS标签

智谱AI清影实测：6秒视频排队2分钟猫猫很可爱人手很翻车_视频_模子

相关推荐

WorkFlows规则头条视频高效生产背后的秘密

今日头条视频捷径规则解读助力创作者高效创作，提升内容质量

今日头条视频压缩算法软件革新视频处理技术，引领行业新潮流

今日头条视频消重算法技术创新引领内容生态建设

优看侠,新时代短视频平台的风向标

栏目热门

热门内容

随机文章

推荐内容

最新内容

TAGS标签