视频人物转身回来别换脸!快手等给生成模型留住中间记忆
南京大学、清华大学、快手、上海人工智能实验室等机构提出Memory Forcing,为视频生成保留开头、近期和中间事件三类记忆。它让模型在视频继续变长时,还能查到早先发生的内容。在1.3B模型测试中,VBench综合分从5秒的83.88到6
南京大学、清华大学、快手、上海人工智能实验室等机构提出Memory Forcing,为视频生成保留开头、近期和中间事件三类记忆。它让模型在视频继续变长时,还能查到早先发生的内容。在1.3B模型测试中,VBench综合分从5秒的83.88到6
复旦大学、微软研究院等机构提出Compo,让用户在画布上安排图片、文字和位置,再生成海报。输入可以明确某个人物放哪里、文字写什么、哪些部分保持原样。它将布局要求变成空间约束,减少仅靠长提示词描述排版时的歧义。
苹果研究团队提出GHARP,用少量人物照片建立数字人,再用表情信号驱动脸部动画。它把一次性的建脸与持续的动脸分开计算。在论文的A100测试中,动画阶段相对对照方法最高快约13倍,输入照片增多时,每帧动画开销仍保持固定。
浙江大学、浙江工业大学等机构提出Pumpire,用100个真实场景检查三维重建的距离是否准确。它比较模型给出的点间距离与实测值,并考察深度信息对结果的影响。桌椅看起来像原场景,还需要量一量,才能判断三维几何能否支持实际测量。
剑桥大学、上海交通大学、特温特大学、华威大学联合提出MESSENGER,为连续点云运动预测加入记忆和不确定性估计。nuScenes第四个未来帧的平均误差从0.088米降至0.025米,下降71.6%。模型保留多个历史时刻的信息,再按可靠程度
谷歌、特拉维夫大学等机构提出SepGen,生成视频时同时输出混合音频与两个独立声轨。示例包括演唱与乐器、人声对话等场景。同一模型还可以接收已有视频和音频进行分离,让画面中的发声对象参与判断声音应该归到哪一轨。
Meta Reality Labs、加州大学戴维斯分校、北卡罗来纳大学教堂山分校等机构提出GNR,从成功轨迹中学习如何生成机器手动作。HOT3D仿真测试中,采样量只用对照的8.5%,成功率从27.2%升至56.2%。团队由此扩展出约22.3
卡内基梅隆大学、Meta联合提出SLVR,让AI先定位图片里的目标,再挑证据、组织答案,推理时不必写出长段过程。在300项带错误描述的诊断测试中,正确率从41.7%升至70.7%。模型可以回到画面核对颜色、数量和空间关系,减少跟着文字猜答案
谷歌、伊利诺伊大学厄巴纳香槟分校等机构提出BudgetPix,把生成图像的计算按细节复杂度分配。背景用较大的图块,复杂纹理保留细小图块。在论文的两组文本生图测试中,模型使用约25%的计算预算,仍得到接近完整预算的图像保真度。
微软研究院、悉尼大学等机构提出VibeEdit,把修图指令放回图片画布:圈选、涂画、拖动和短注释共同指定要改的对象。用户可以直接指向一把椅子,而不用长篇描述它在画面中的位置。研究团队训练了五类编辑操作,并在419个手工整理的测试样例中检查编
亚利桑那州立大学、约翰斯·霍普金斯大学提出TileSkipper,为已经训练好的3D高斯场景预先分配不同渲染阈值。在3840像素宽的固定策略扫描中,数据集宏平均加速达到1.238倍,平均PSNR变化为负0.023分贝。导出策略每个高斯只增加
星动纪元、清华大学、香港科技大学(广州)等机构提出VPP2,先训练模型按操作指令预测后续视频,再把预测能力用于机器人动作学习。14B版本在视频指令跟随测试中平均成功率85%,高于Cosmos3-64B的74%。模型先预测接下来可能出现的画面
南加州大学、加州大学圣迭戈分校研究了修图AI遇到无解要求时会不会停手,并训练出VisTA-BAGEL。模型先检查要求能否成立,再决定生成图片或说明矛盾。在DoD测试中,它无须额外提醒就能拒绝93%的不可行请求,同时完成74.3%的可行编辑,
香港理工大学、OPPO研究院提出PVD,让两个半尺寸专家接力完成画图:前段确定结构,后段补细节。两段累计计算接近原始骨干的一次前向计算,三种文生图模型的峰值显存减少45.76%至48.36%。论文同时展示了猫、花束、咖啡与风景等生成对照,检
Adobe研究院、罗切斯特大学提出ALIVE,让后加进视频的物体跟着原有动作参与互动。用户改好第一帧,再写出物体名称,模型就能生成拿杯子、戴耳机、打开电脑等效果。在128例交互编辑测试中,它的综合得分由对比方法的60.24提高到86.71,
微软、香港理工大学、加州大学戴维斯分校等机构提出ProAR,让持续生成视频的模型同时预想最终画面和下一步状态。VBVR十项任务中,平均成绩从0.663升到0.801;训练2500步时就超过训练10000步的标准基线。视频生成开始按目标和规则
斯坦福大学、约翰斯·霍普金斯大学、麻省理工学院、马克斯·普朗克智能系统研究所等机构提出4DCodeBench,让AI观看视频并编写能重建场景运动的图形代码。18个模型在200个场景中接受检验,榜首模型静态成绩0.91、动态0.67。评测把外
哈佛大学、麻省理工学院、约翰斯·霍普金斯大学等机构提出MoSE3,从单目视频同时估计每个像素的三维移动、旋转和共同运动分组。团队还构建了5000个合成场景补充运动标注。在iTACO上,完整分组版本的逐像素旋转误差为12.30度,让物体怎么动
阿里巴巴、香港中文大学(深圳)、南京大学等机构提出Spatial Memory Intelligence,让理解模型整理世界模型的历史画面。在HY1.5实验中,它删去83.68%的记忆条目,场景一致性评分从51.61提高到67.02。回到之
庆熙大学、得克萨斯大学奥斯汀分校等机构提出Custom Forcing,把参考图直接放进视频模型的长期缓存,生成特定对象时无需为它单独训练。两分钟视频中,主角相似度指标维持在约0.58至0.62。方法根据身份漂移程度加强参考信息,让持续生成