商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 从Kling O1到VIDEO 2.6,可灵AI加速统一多模态与音画同出能力落地

从Kling O1到VIDEO 2.6,可灵AI加速统一多模态与音画同出能力落地

  发布于2026-06-05 阅读(0)

扫一扫,手机访问

2025年底,可灵AI接连放出了两个重磅更新:Kling O1和Kling VIDEO 2.6。前者是一套统一多模态视频创作引擎,能把文本、图像、视频、主体参考全部塞进同一个模型里;后者则实现了“音画同出”,用户生成的10秒内视频自带语音、音效和环境声。这两步棋踩在了同一个趋势上——AI视频工具正在从“生成单帧画面”进化成“辅助完成整条创作流水线”。 --- 先说Kling O1。它真正有意思的地方在于“统一输入”和“统一任务”。官方公告把它描述成一个整合了参考生成、文生视频、首尾帧、视频补绘、视频转化、风格化、视频延展等能力的创作引擎。翻译成大白话就是:创作者不用再为了不同的需求来回切换好几个模型或工具,而是可以在同一个界面里,同时上传文本提示词、图片、视频片段、主体参考图,然后让模型根据这些素材综合产出。比如广告团队,可以把产品图、人物图、背景图一股脑丢进去,再描述一遍镜头运动和视觉风格,模型直接生成产品展示片段;影视团队也能靠角色和道具参考图,保证连续镜头里的视觉一致性。这对创意流程的简化是实打实的。 --- 再来看Kling VIDEO 2.6。它解决的是AI视频创作里一个久治不愈的痛点:声音。以前大多数AI视频工具生成的都是哑巴片,创作者还得在剪辑软件里自己补旁白、对白、音效和环境声。2.6支持文本到音画视频、图片到音画视频,能生成自然语音、动作音效和环境氛围,同时覆盖中英文语音,最长10秒。这玩意儿对社交媒体短片、电商产品介绍、品牌广告、剧情小片来说都很实用——尤其适合快速验证一个创意在视听层面到底能不能成立。不用等配音和音效做完,就知道这个镜头配这段声音顺不顺。 --- 这两项能力一起放出来,内容团队的分工方式也在悄悄变化。过去一个短片草案,得先从脚本到分镜,再找视觉参考,然后配音、音效、剪辑,一整套流程跑下来才能看到雏形。现在团队可以先用O1把一致性素材和镜头方向定下来,再用2.6把音画关系跑一遍,最后才进入人工剪辑、调色、混音和合规审查。AI不一定直接出最终成片,但它能把从创意到样片的时间压缩好几倍。 --- 当然,O1和2.6也不是万能钥匙。O1的多模态编辑对输入素材质量、提示词结构和参考关系非常敏感,稍微偏差一点就可能翻车;2.6虽然能生成声音,但商业广告里对配音质感、语气控制、品牌规范和音频版权的要求依然很高,这些环节目前还得人工复核。另外,随着VIDEO 3.0上线,O1和2.6的部分能力已经被进一步整合和升级了。如果手头有新项目启动,建议把3.0作为主评估对象,同时把O1和2.6保留成特定场景下的备选工作流工具。
本文转载于:https://www.php.cn/faq/2597711.html?uid=1431639 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注