arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.06099 视觉与生成

镜头没拍到的地方也能补:复旦PASTEL把4D场景再推高0.9 dB

复旦大学、华为中央媒体技术研究院联合提出PASTEL,把单目视频已拍到的区域做4D重建,再用生成先验补出相机视野之外的合理内容。它把复杂的新视角搜索压到全景空间中的二维方向规划,并在DyCheck iPhone数据集上把全图PSNR比此前最

复旦大学、华为中央媒体技术研究院等
文章封面
2609.05981 AI基础设施

扩散模型少算19.3%画质还更稳,阿里云等用不确定性管缓存

上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS

上海交通大学、阿里云终端智能计算部、复旦大学等
文章封面
2609.08273 Agent

阿里等把智能体记忆砍半,性能还留99.7%、检索快2.24倍

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学等
文章封面
2609.09133 Agent

测试写错还不如不测:微软等让代码智能体修复率冲到72.6%

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院等
文章封面
2609.08365 视觉与生成

动作生成砍掉一整个阶段,北大等ReMoMask-2反而更快更准

悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并

悉尼大学、北京大学、中国科学院大学等
文章封面
2609.09020 AI基础设施

神经压缩跑过JPEG?PIC做到20 FPS编码、2000 FPS解码

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院等
文章封面
2609.08084 视觉与生成

一张照片也能看清发丝深度,Marigold V2误差再降16%—26%

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学等
文章封面
2609.08117 自动驾驶

斯坦福等做出393小时驾驶员动作库,转向前手臂运动多3.4倍

南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学联合建立DriveMotion,把360位驾驶员的393小时座舱视频整理成133关键点连续动作序列。论文发现,车辆机动前窗口的手臂运动幅度是同路线稳定驾驶对照的3.4倍。它提供的是数据集与

南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学等
文章封面
2609.06009 具身智能与机器人

机械手学会预判人类会喊停的动作,抓取成功率做到96.7%

香港科技大学(广州)、意大利技术研究院、浙江大学联合提出WHIRL,让机械手把人类接管动作当成风险信号,提前避开操作者可能喊停的状态。16自由度LEAP Hand在指定复杂抓取任务中做到96.7%成功率,按操作步数计算的人工干预最多减少84

香港科技大学(广州)、意大利技术研究院、浙江大学等
文章封面
2609.06251 具身智能与机器人

北大等让宇树G1边走边干活,完整任务成功率提高10个百分点

北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样

北京大学、华南理工大学、新加坡国立大学等
文章封面
2609.05093 更多前沿

只花27.72美元,AI在15轮内打破10项圆堆积纪录

Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半

Practical Systems等
文章封面
2609.04531 大模型

写代码从512步砍到1步,杜克清华让扩散模型极速出答案

杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0

杜克大学、清华大学等
文章封面
2609.04802 具身智能与机器人

24小时视频压缩26.1倍,南大华为让机器人记住物体去向

南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远

南京大学、华为、天津大学、不列颠哥伦比亚大学等
文章封面
2609.04540 大模型

只用5%参数追平16亿模型,亚马逊开源Mitra-v2

亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示

亚马逊等
文章封面
2609.05141 大模型

最强AI读论文只拿62.6分,上海AI Lab等推出SciDocBench

香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系

香港中文大学、上海人工智能实验室、复旦大学、上海交通大学等
文章封面
2609.05374 Agent

电脑智能体少点57%步骤,交大浙大让GUI和命令行一起干活

上海交通大学与浙江大学团队提出CUA-Universe,让同一个电脑智能体在图形界面与命令行之间选择操作。9B模型在OSWorld上的成功率提升16.8个百分点,同时步骤减少57%。结果来自特定虚拟机应用和基准任务,说明混合工具有效,但不等

上海交通大学、浙江大学等
文章封面
2609.04355 具身智能与机器人

机器人练45.8分钟做到98.3%,中科大等团队攻克精密操作

中国科学技术大学、北京航空航天大学、中关村学院与合肥星旋科技团队提出VLA-Precision,让机器人直接在真实设备上在线练习高精度化学操作。论文在四种机器人、九项任务上报告98.3%平均成功率,每项平均训练45.8分钟;这些数字来自受控

中国科学技术大学、北京航空航天大学、中关村学院、合肥星旋科技等
文章封面
2609.05416 视觉与生成

一段视频拆出数百个3D物体,阿里等团队提出WorldSculpt

阿里达摩院Alaya实验室与东京大学团队提出WorldSculpt,从一段多视角视频恢复可组合的3D场景,并为其中每个物体输出独立网格。它面向含数百个物体、遮挡严重的场景,却主要用单物体数据微调。结果显示组合式重建可扩展,但真实场景质量仍依

阿里达摩院Alaya实验室、东京大学等
文章封面
2609.04250 视觉与生成

数字人边说边动快5.4倍,北大等团队做出Motion-Omni

北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,

北京大学、香港中文大学(深圳)等
文章封面
2609.05415 视觉与生成

一套模型让万种骨架动起来,普林斯顿等团队提出UniMate

普林斯顿大学、加州大学伯克利分校、麻省理工学院和南洋理工大学团队提出UniMate:输入文字和一副目标骨架,同一个模型就能为人、四足动物、鸟、鱼、昆虫乃至机械结构生成动作。配套UniML3D汇集13006段动作;论文证明的是零样本跨拓扑迁移

普林斯顿大学、加州大学伯克利分校、麻省理工学院、南洋理工大学等
文章封面