复旦、阿里提出AffineTok,20轮训练把图像生成gFID降低26%
扩散模型先在视觉分词器的潜空间里去噪,再把潜变量解码成图像。分词器即使能高质量重建图片,也不一定让后续去噪容易。复旦大学、阿里巴巴提出AffineTok,把潜空间中的语义组织方式纳入训练目标。
扩散模型先在视觉分词器的潜空间里去噪,再把潜变量解码成图像。分词器即使能高质量重建图片,也不一定让后续去噪容易。复旦大学、阿里巴巴提出AffineTok,把潜空间中的语义组织方式纳入训练目标。
给AI一组“变化前—变化后”的图片,再给一张新图,让它照着示例完成同类编辑。现有视觉上下文学习擅长颜色、材质和外观迁移,却常忽略物体结构、相互作用和环境条件。北京大学、商汤研究院、浙江大学提出TransPhy,把任务拆成物理规则推断和结果渲
输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。
只要镜头快速转动、前景有人群穿过,或大半画面被水面和白墙占据,三维重建就可能把相机轨迹算错。Google DeepMind、多伦多大学、西蒙菲莎大学提出ORBIT,用100段来自360°视频的真实片段,专门测试运动恢复结构在动态、低纹理和复
水下单目视频不仅缺少尺度信息,还会被光线衰减、散射和颜色偏移干扰。浙江大学、上海人工智能实验室、上海交通大学、清华大学等机构提出AquaFlow,让系统一边接收视频,一边估计相机轨迹并更新3D高斯场景。62条水下轨迹上,平均定位误差比Wat
给模型一张优秀网页截图,它能学到最终像素,却看不到设计师如何选图层、建样式、调整间距、撤销错误。Patronus AI推出FigmaTrace,记录超过200小时的人类Figma操作视频,将其转换为3469条设计轨迹,覆盖126项开放式长程
在生成场景里向前走、转弯或绕着角色移动时,画面、环境声、音乐和对白同时延续。京东探索研究院、香港科技大学、北京大学、斯坦福大学等机构提出EchoWM,用连续导航信号控制720p视频,并联合生成与场景同步的音频。
交互式世界模型跟随按键向前走并不难,难的是走远以后再回来,场景还要与起点一致。香港科技大学(广州)、阿里巴巴ATH实验室提出ReWorld,在64秒、384个潜变量的往返轨迹中,只保留固定12个视频块的缓存,仍能恢复开头看到的场景。
同一个视频模型,既能从文字或图片生成画面,也能改角色、传递首帧编辑、转换已有视频和重新安排镜头。Adobe研究院、罗切斯特大学提出EditStream,把六类生成与编辑任务合进一套DiT权重,再将多步扩散过程压缩为4步自回归推理。论文评测中
“拿住杯把”“按下按钮”“握住喷嘴”都要求机器人把一句自然语言落到物体的具体3D区域。以往方法常假设已经有完整点云和固定动作类别。同济大学与中国科学院提出AffordAny,从一张RGB图片出发重建物体,再根据自由文本定位可操作部位。自动管
把厨房角落的第三人称录像改成操作者头戴相机视角,镜头旋转幅度可能超过普通新视角合成的范围,身体和台面还会遮住大量区域。NVIDIA提出Grounded-Exo2Ego,从单段外部视频重建场景几何,再用物体级语义补全第一人称镜头中原视频看不到
视频模型做强化学习时,一组采样答案可能全都不够好,模型只能在一堆错误里挑相对高分者。南开大学、西北工业大学、中科院自动化所和南开深圳研究院提出OraRL,把每条人工标注直接序列化成一条“标准轨迹”,同时保留模型自己的探索。Video-ORA
一张表单里,“项目名称”对应哪段长文本、一个字段是否连着多个值,传统流程通常先OCR,再做实体识别与关系抽取。IBM苏黎世研究院和苏黎世联邦理工提出端到端方案,微调2.56亿参数SmolDocling,直接从文档图片生成键、值、边界框和连接
用手机随手拍一段人物视频,想得到能从任意方向观看的动态模型,单目画面缺少背面与侧面信息。浙江大学、蚂蚁集团、香港中文大学、香港科技大学等机构提出4DAnyone,先生成多视角一致视频,再把它提升为4D高斯泼溅表示。
文本生成3D要么逐个预测形状Token,速度慢且前面出错后难以修正;要么反复更新完整3D表示,计算量随精度增加。浙江大学、加州大学伯克利分校、武汉大学等机构提出Block3D,把形状序列切成连续块,块之间自回归、块内并行去噪。
第一人称视频中,手经常被物体挡住,甚至短暂伸出画面。南洋理工大学、香港中文大学、上海交通大学、ACE Robotics等机构提出DreamHand,把视频扩散模型当作确定性几何编码器,用完整片段恢复连续双手3D轨迹。
让视频模型把绳结解开、让齿轮按规则转动,或沿迷宫走到出口,画面好看不等于过程正确。微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等机构提出VGI-Bench,用27项任务、810个实例测试视频生成模型能否通过连续画面完成视
给出多张人物参考照,再要求AI把所有人放进同一张合影,人数一多就容易漏人、重复或贴上一张原脸。腾讯混元、复旦大学、香港大学联合提出WithEveryone,把身份、位置和姿态先做成结构化计划,再据此生成最多包含10个指定身份的群像。
照片已经拍完,还能向左换机位、拉长焦距、调高曝光,并让同一物体在所有新视角里保持一致。南京大学、vivo提出ReX-Shot,从一张参考图同时控制视角、连续焦距和色温、曝光、饱和度等摄影参数,论文系统达到接近实时的交互速度。
给系统一段真实音乐,它要决定什么时候抬手、哪根鼓槌打哪面鼓,还要让肩膀和躯干看起来像人在演奏。迪士尼研究工作室、特拉维夫大学、苏黎世联邦理工提出一套音频驱动的扩散模型,把身体自然度和鼓槌落点精度分开优化,生成动作可达到厘米级落点控制。