谷歌等让AI反复改论文图,质量提升最高18.6分
谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3
谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3
黎曼动力学发布Matrix-Game 3.5,把交互式世界模型的连续生成拉到分钟级,并支持用户实时控制镜头。系统在Matrix-Game 3.0基础上加入几何感知记忆、静态与动态分离表示,以及两阶段实时蒸馏,目标是让生成世界转身后还能记得来
字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。
南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准
视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。
输入一张普通RGB照片,模型同时输出单目深度和表面法线。萨里大学、帝国理工学院等机构提出GeoNeXt,把预训练视频生成模型改造成统一几何学习器:原图是第一帧,深度与法线成为后续“几何帧”,三者沿同一去噪过程生成。
输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布
长视频做三维重建,最直接的办法是让模型不断回看过去所有画面,代价是内存和计算随视频长度增长。阿里巴巴高德视觉团队提出ABot-Recon,只固定保留第一帧和最近10帧,就能连续估计相机轨迹、深度与场景点云。
拍好的一段单目视频,输入一条新的六自由度相机轨迹,模型就沿新机位重新生成画面。浙江大学、Manifold Tech、上海科技大学、剑桥大学等机构提出Manifold4D,处理视频换机位重拍时最容易出现的几何漂移和相机控制误差。
同一笔训练预算,是把驾驶视频模型做得更大,还是让现有模型多看几遍数据?法雷奥AI与索邦大学的研究团队提出VATIX缩放研究,覆盖从100万到约90亿参数的视频扩散模型,并在最高5500小时驾驶数据上改变训练曝光量,得到一组面向固定数据池的缩
自回归视频模型按片段向后生成,人物或物体离开镜头几十秒后再出现,颜色、形状和位置很容易变化。斯坦福大学、北京大学、字节跳动等机构提出Ring Forcing,通过环形训练、历史压缩和稀疏位置编码,让模型使用分钟级远距离信息。
同一个人物视频,既可以用来识别情绪,也可以测试视频生成、声音克隆和人物抠像。深圳大学、中科院自动化所、清华大学、华为等机构推出HUG-VIS,用8400段同步视频、音频、文本和透明度蒙版,把四类任务放在同一套受控素材上比较。
视频世界模型离开一个场景再返回时,如果新画面与第一次访问高度相似,常被解释为“记住了”。阿里巴巴、同济大学、上海交通大学提出R2M-Bench,指出模型只要几乎不移动,也能得到漂亮的绝对相似度。
车载激光雷达的一次扫描只占目标三维体积约1%,其余位置既没有几何信息,也没有类别标签。复旦大学、卡内基梅隆大学提出生成式语义场景补全GSSC,用一套离散扩散框架同时合成训练数据、从噪声生成完整场景,并修正已有模型的输出。
机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。
低清商品图里的针织花纹已经糊成一片,生成式超分常会补出看似清晰、实际不存在的纹理。阿里淘天集团、中国科学院大学提出GraftSR,不让模型凭经验猜细节,而是读取同一件商品的另一张高清照片,把可确认的纹理移到目标位置。
“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每
模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。
拖动一个物体的三维轨迹、改变相机运动,再让视频继续往后生成,过去通常要分给不同模型处理。北京大学、腾讯混元提出4DStreamCtrl,把相机、物体和深度都编码成三维点轨迹,在一次前向计算中完成联合控制。
从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。