作为少有的全民级晚会平台,春晚在过去十年里一直是各互联网公司重要的新用户增长渠道,它与一众互联网产品之间的合作也几乎与 “红包” 绑定。从 2015 年开始,微信、支付宝、淘宝、京东、抖音、拼多多、快手等知名互联网产品均在春晚上发放过红包福利。
但在今年春晚,冠名方火山引擎接到的第一个任务却是与舞台视觉相关的。
一位字节跳动人士告诉我们,今年春晚导演组一直在探索将最新科技和传统文化艺术相结合。因此作为独家 AI 云伙伴,火山引擎及其背后的字节跳动不仅要以赞助方身份参与冠名,还要把 AI 与云计算能力嵌入到春晚节目的创作与制作流程中。
在《驭风歌》这个节目里,歌手身后出现了一幅国宝级的骏马水墨画。节目筹备时,导演组并不满足于将其当作一个静态背景,而是希望让这些马匹在舞台空间里动起来,并与歌手互动。
为了达成这个效果,他们最初试过一些海外模型,但大多抓不住水墨画的气韵;国内模型也同样受限,水墨风格的高质量训练语料稀缺,生成出来的画作风格容易跑偏。更棘手的是运动一致性:马要跑得流畅,却又必须在每一帧都贴合原画的笔触与结构、不变形;马匹的数量、每匹马之间的动作都要始终保持一致。
转折来自字节跳动团队带来的 Seedance 2.0。这个全新的视频生成模型不仅能更好地遵循物理规律,让马的步态更接近真实,关节衔接自然、动作连贯;还能很好地遵循导演的要求,实现像 “跑慢一点”“鬃毛飘动轻一点” 这类带副词的细微调度指令。它还有另一个重要的突破——模型不再是只能学单张图的风格,而是能同时学习大量不同风格的多模态素材。
一位字节春晚项目组人士告诉我们,他们把导演组画的草图、水墨画作,还有许多关于马的影像素材一起喂给模型,通过参考生成的方式,实现画风与动作能稳定地在同一个标准之下生成。他们还绕开了直接写提示词的方式,改用 Seedance 2.0 与图像生成模型 Seedream 协作:先由 Seedream 生成每一帧关键帧,再由 Seedance 在关键帧约束下生成动态视频,实现了风格的一致性和运动的连贯性。
把理想中的效果表现出来只是第一步。春晚的每个节目迭代频率都极高,因此字节团队常遇到的情况是,刚交付一版满意的画面,导演组马上提出:“能不能再往前走一步”。这些节目还需要经历反复过审与验收,这也意味着他们每次都必须拿出更好的版本。“整体节奏基本得按 ‘周’ 来迭代推进。” 上述字节春晚项目组人士说。
很快新的难题又出现了。虽然《大闹天宫》《小蝌蚪找妈妈》等上美影经典作代表了手绘全动画的巅峰,但在 AI 数字化生成的语境下,如何在高帧率、高分辨率的现代广播标准中,让水墨这种 ‘无边界’ 的艺术形式在高速大运动下不闪烁、不崩坏,是行业公认的难题。
考虑到主流视频生成模型通常输出 720p 或 1080p 分辨率、24 帧/秒的视频,字节团队将突破点放在后处理链路,借助火山引擎视频点播的画质增强能力升级画质:先通过超分技术,在不改变画面内容的前提下将较小尺寸的画面放大至 6K 或 8K;再通过插帧技术将帧率从 24FPS 提升至 50FPS。这套处理也非一刀切的通用算法,而是能根据每一帧画面的画质与内容特点做专属优化。最终他们顺利解决了这个难题。
除了舞美,字节团队还将 AI 能力带入了春晚的多个环节。舞台上出现的机器人接入了豆包的视觉大模型、文本大模型和语音识别模型,语音侧采用了豆包的合成与复刻模型。模型让它们不仅有了 “大脑”,还装上了 “嘴巴” 和 “耳朵”。
他们还提前收集了舞蹈演员的 3D 素材,再利用了空间视频技术,将舞蹈演员制作成 3D 数字分身,在舞台上实现真人 3D 克隆效果让观众难辨真假。最后又加上了字节自研的 4D 高斯算法、豆包大模型优化光影效果。
豆包 App 是今年春晚与观众互动的核心载体。与往年常见的在互联网产品上摇红包、抢红包不同,今年互动流程改为,用户需先在豆包上用大模型生成头像或新春祝福,再抢红包。这样的变化极大抬高了成本——以往红包互动形式的主要开销集中在网络、IO 和实时连接,现在则在原有基础上叠加了庞大的算力请求与算力支出。
调控算力资源的难题也在大幅上升。一位字节的春晚项目组人士保守测算,用户生成一条新春祝福或一张图片,一次请求就需要完成 10 TOPS(每秒 10 万亿次操作)的计算量。而以往类似互动请求的计算量仅约 1/100000 TOPS,两者在算力需求上相差了整整 100 万倍。与此同时,他们在除夕当晚还要应对抖音、今日头条等产品春节活动带来的大模型调用。
由于时间紧迫,字节没办法靠临时堆机器顶住算力洪峰。好在火山方舟顶了上来,这是字节统一调度算力的总控台,长期在字节和外部客户的各类高并发场景中沉淀了资源调度能力。火山方舟的一个特点是将推理、训练和离线任务放进同一资源池统一统筹,因此在春节算力与流量峰值来临时,系统能把可延迟的负载错峰挪开,为各类春节活动腾出更多资源。
这不是件容易做到的事情。它涉及到海量场景、多个机房、多种机型和多类模型,还要持续动态分配资源。一位火山引擎人士把这个过程形容为 “装箱”:一方面,不同流量的延迟要求不同、对异构硬件的依赖不同,约束极多、解空间巨大;另一方面,大模型推理不像传统 CPU 服务那样资源类型相对统一,同一个推理服务里也可能混用多种硬件。更麻烦的是,GPU 的迁移不是单点动作,存储、网络、上游负载均衡等配套资源也要协同迁移,否则算力挪过去也接不住流量。
“冠名春晚对字节来说,不再是一场简单的增长活动,它更像一次真正的技术试炼。” 一位字节跳动人士说。