镜头没拍到的地方也能补:复旦PASTEL把4D场景再推高0.9 dB
复旦大学、华为中央媒体技术研究院联合提出PASTEL,把单目视频已拍到的区域做4D重建,再用生成先验补出相机视野之外的合理内容。它把复杂的新视角搜索压到全景空间中的二维方向规划,并在DyCheck iPhone数据集上把全图PSNR比此前最
复旦大学、华为中央媒体技术研究院联合提出PASTEL,把单目视频已拍到的区域做4D重建,再用生成先验补出相机视野之外的合理内容。它把复杂的新视角搜索压到全景空间中的二维方向规划,并在DyCheck iPhone数据集上把全图PSNR比此前最
上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS
上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准
威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质
悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并
清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解
洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、
南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学联合建立DriveMotion,把360位驾驶员的393小时座舱视频整理成133关键点连续动作序列。论文发现,车辆机动前窗口的手臂运动幅度是同路线稳定驾驶对照的3.4倍。它提供的是数据集与
香港科技大学(广州)、意大利技术研究院、浙江大学联合提出WHIRL,让机械手把人类接管动作当成风险信号,提前避开操作者可能喊停的状态。16自由度LEAP Hand在指定复杂抓取任务中做到96.7%成功率,按操作步数计算的人工干预最多减少84
北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样
Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半
杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0
南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远
亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示
香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系
上海交通大学与浙江大学团队提出CUA-Universe,让同一个电脑智能体在图形界面与命令行之间选择操作。9B模型在OSWorld上的成功率提升16.8个百分点,同时步骤减少57%。结果来自特定虚拟机应用和基准任务,说明混合工具有效,但不等
中国科学技术大学、北京航空航天大学、中关村学院与合肥星旋科技团队提出VLA-Precision,让机器人直接在真实设备上在线练习高精度化学操作。论文在四种机器人、九项任务上报告98.3%平均成功率,每项平均训练45.8分钟;这些数字来自受控
阿里达摩院Alaya实验室与东京大学团队提出WorldSculpt,从一段多视角视频恢复可组合的3D场景,并为其中每个物体输出独立网格。它面向含数百个物体、遮挡严重的场景,却主要用单物体数据微调。结果显示组合式重建可扩展,但真实场景质量仍依
北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,
普林斯顿大学、加州大学伯克利分校、麻省理工学院和南洋理工大学团队提出UniMate:输入文字和一副目标骨架,同一个模型就能为人、四足动物、鸟、鱼、昆虫乃至机械结构生成动作。配套UniML3D汇集13006段动作;论文证明的是零样本跨拓扑迁移