Meta等提出Map-Det3D:不用深度相机,只靠连续RGB也能在线定位3D物体
Meta Reality Labs、苏黎世联邦理工和波恩大学提出Map-Det3D,只读取连续RGB画面,就能在线重建带米制尺度的三维空间,并直接预测物体3D框。它不依赖深度相机,也不沿用“先在2D图像检测,再为每个框猜深度”的常见流水线。
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
Meta Reality Labs、苏黎世联邦理工和波恩大学提出Map-Det3D,只读取连续RGB画面,就能在线重建带米制尺度的三维空间,并直接预测物体3D框。它不依赖深度相机,也不沿用“先在2D图像检测,再为每个框猜深度”的常见流水线。
阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重
多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求
只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演
一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99
机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO
输入一段说话视频、一张参考人物照片和一小段参考声音,UniSwap会把画面中的外貌和说话音色一起替换,同时保留原视频的动作、场景、台词内容与音画节奏。香港中文大学和阿里通义应用业务团队把过去分开的换脸与变声装进同一个音视频扩散Transfo
一张多人照片里,输入“穿红衣服的男孩”,模型先找到指定人物,再画出他的视线落点;也可以直接点击画面坐标来选人。Google与伊利诺伊大学香槟分校提出GazeAnywhere,并开源12万组带提示标注的Gaze-Co数据,把注视估计从固定检测
字节跳动、AMD和香港理工大学等团队提出Avatar-Forever,让22B视频基础模型在单张H100上以27.2 FPS生成768×512音频驱动数字人。架构采用流式输出,不设固定总时长,并针对自回归视频常见的“越播越糊、人物越播越不像
给一张人物照片,再持续输入身体姿态和面部动作,14B参数的视频模型可以像直播一样连续输出动画。香港中文大学、阿里通义应用业务和LiblibAI提出LiveAnimate,在两张NVIDIA H100上达到19.63 FPS,并在3分钟测试中
日本电气通信大学团队设计了一种混合硬度仿生指尖,中央指肚使用软硅胶,两侧换成更硬的材料,内部保留类似指甲的刚性结构。机器人不用先把硬币推到桌边,也不需要在底部留缝,就能从硬平面上抬起硬币。
东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。
清华大学、澳门科技大学、东南大学、爱丁堡大学和FellouAI等团队提出浏览器Agent基准CAP。它不只检查Agent能否打开页面并点击按钮,而是要求跨多个网站完成长流程,处理复杂控件和动态视觉内容。
复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。
阿里淘天集团与上海交通大学提出REST,将图像生成的奖励对齐和少步蒸馏放进同一训练阶段。它直接复用扩散强化学习已经生成的带奖励轨迹,不再单独采样蒸馏数据。
字节跳动提出面向游戏资产的RGBA视频生成方法GameAlpha。它从一张参考图出发,一次生成RGB彩色帧和Alpha透明遮罩,角色动画可以直接叠加到不同背景中。
Meta AI、普林斯顿和MIT提出Gambit,把大模型的测试时推理改成“思维层面的束搜索”。它不再让大量推理轨迹各自跑到底,而是周期性砍掉低质量路径,把释放的算力立即用来复制更好的思路前缀。
Adobe与加州大学圣迭戈分校提出潜动力学推理LDR,让视频世界模型不只生成“看起来合理”的下一帧,而是显式学习物体随时间的运动规律。
Google Research和Google DeepMind把医疗对话系统AMIE扩展到实时视频问诊。新系统能在交谈时分析声音和画面,记录动作、表情与身体观察,再将这些信息纳入诊断和处置。
阿里达摩院与湖畔实验室提出并开源机器人价值基础模型RynnValue。它用超过7000小时的多源机器人数据学习“当前状态距任务完成还有多远”,再把这个判断转成训练策略所需的稠密奖励。