发布于2026-06-04 阅读(0)
扫一扫,手机访问
就在刚刚,京东放了个大招——正式推出名为 JoyAI-Echo 的长音视频生成框架。这玩意儿一出来,就直接冲着行业里头最让人头疼的三个老大难问题去的:角色容易崩、声音说变就变、生成速度慢得像蜗牛。而且,它还搞了个“对话式编辑”的功能,意思是以后想改某个镜头,不用再把整条视频重新跑一遍了。

京东自己说,JoyAI-Echo 的发布,标志着他们在长视频生成领域已经踏进全球第一梯队了。这话听着有点狠,不过看技术细节,确实有点东西。
这套框架内置了一个专门的“记忆库”。在多镜头生成的过程中,它能持续保存并调用角色的外观特征和说话人的音色信息。实测下来,长达5分钟的视频里,角色的身份、视觉形象、声音音色都能保持高度一致——再也不会出现同一个人演着演着突然变成另一个人的尴尬局面了。
团队还提出了一种记忆驱动的后训练流程,结合了 SFT、跨模态 RLHF 以及 Distribution Matching Distillation(DMD)技术。不光提升了生成质量,还顺手做了推理加速。光 DMD 这一项,就带来了大约 7.5 倍的速度提升。另外,JoyAI-Echo 里还塞了一个智能“导演助理”——Director Agent,你直接用自然语言说需求,它就能自动拆解成剧本、角色、场景和镜头。
除此之外,它还配了一套实时的超分模块。通过单步超分就能生成高分辨率视频和精细化音频,支持两档分辨率提升:736×1280 → 1152×1920 和 736×1280 → 1472×2560。对于追求画质的场景来说,这个能力很实用。
总的来说,这次京东在长视频生成上的突破,解决的都是实际落地的硬骨头。从角色一致性到生成效率,再到编辑灵活性,算是给出了一套完整的方案。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9