美团北大清华等开源AutoDesign:40分钟把论文做成会议海报,成本不到3美元
把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A
把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A
Meta Reality Labs、苏黎世联邦理工和波恩大学提出Map-Det3D,只读取连续RGB画面,就能在线重建带米制尺度的三维空间,并直接预测物体3D框。它不依赖深度相机,也不沿用“先在2D图像检测,再为每个框猜深度”的常见流水线。
阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重
多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求
输入一段说话视频、一张参考人物照片和一小段参考声音,UniSwap会把画面中的外貌和说话音色一起替换,同时保留原视频的动作、场景、台词内容与音画节奏。香港中文大学和阿里通义应用业务团队把过去分开的换脸与变声装进同一个音视频扩散Transfo
一张多人照片里,输入“穿红衣服的男孩”,模型先找到指定人物,再画出他的视线落点;也可以直接点击画面坐标来选人。Google与伊利诺伊大学香槟分校提出GazeAnywhere,并开源12万组带提示标注的Gaze-Co数据,把注视估计从固定检测
字节跳动、AMD和香港理工大学等团队提出Avatar-Forever,让22B视频基础模型在单张H100上以27.2 FPS生成768×512音频驱动数字人。架构采用流式输出,不设固定总时长,并针对自回归视频常见的“越播越糊、人物越播越不像
给一张人物照片,再持续输入身体姿态和面部动作,14B参数的视频模型可以像直播一样连续输出动画。香港中文大学、阿里通义应用业务和LiblibAI提出LiveAnimate,在两张NVIDIA H100上达到19.63 FPS,并在3分钟测试中
阿里淘天集团与上海交通大学提出REST,将图像生成的奖励对齐和少步蒸馏放进同一训练阶段。它直接复用扩散强化学习已经生成的带奖励轨迹,不再单独采样蒸馏数据。
字节跳动提出面向游戏资产的RGBA视频生成方法GameAlpha。它从一张参考图出发,一次生成RGB彩色帧和Alpha透明遮罩,角色动画可以直接叠加到不同背景中。
Adobe与加州大学圣迭戈分校提出潜动力学推理LDR,让视频世界模型不只生成“看起来合理”的下一帧,而是显式学习物体随时间的运动规律。
把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力
奥尔堡大学、上奥地利应用科学大学等机构的研究者提出一套RGB与热红外视频融合方法,用于无人机马鹿调查,相关工作入选ECCV 2026。在4次飞行记录的26只马鹿中,融合方法正确分类25只;单独使用任一模态都只能认对20只。普通相机会让棕色身
给花朵换颜色、改海报上的文字,生成模型往往能改对内容,却在掩码边缘留下色差、硬线或纹理断裂。商汤研究院、北京航空航天大学与南洋理工大学等团队提出MaskFlow,把编辑区域直接写进生成路径,并用Soft-Poisson机制处理边界融合。完整
让视频世界模型模拟“向前走、转弯、再回到原地”,画面经常会悄悄换成另一处。英伟达、普林斯顿大学、多伦多大学与Vector Institute提出WorldTrace,无需重新训练模型,只改推理时的记忆缓存,就能把持续时间从数秒推向分钟尺度;
让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐
训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。
输入人物描述和长段讲话文本,不提供音轨,也不提供第一帧,模型可以一边生成声音一边生成画面。Vorch团队联合同济大学、哈工大(深圳)和上海交大公布Vorch-Streamer,在单张H200上达到27.12 FPS。
一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。
视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。