据彭博社最新消息,由张一鸣亲自牵头督战字节跳动正在秘密研发一款实时空间视频模型,最快将于今年 10 月正式亮相。该模型基于 Seedance 底座构建,核心突破在于“实时交互”——能根据用户的语音与动作实时生成动态、可互动的 3D 虚拟世界。
这套技术将直接深度绑定旗下 Pico 头显:
云端推流架构:核心计算放在云端,大幅降低头显端的本地算力门槛与硬件成本。
低延迟表现:云端渲染帧率达 20 fps,端到端延迟压至 0.05 秒左右。
不得不说,回顾这几年的 AI 发展:“Google 负责在前面流血趟雷,大家负责摸着 Google 稳稳过河”。
基础架构上,Google 2017 年发了一篇论文搞出 Transformer,转头就被 OpenAI 拿去炼出了 ChatGPT;
对话模型上,Google 最早捣鼓 LaMDA,结果把全世界注意力全拱手送给了基于它思路爆发的 GPT;
视频生成领域也是如此,去年初 Google Veo3 音画同出惊艳全场,各家立马跟进卷到起飞;
如今世界模型,去年底 Google 搞出 Genie 3 验证了可行性,。。。
某种程度上,大家还真得感谢 Google。