arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.11382 具身智能与机器人

6架无人机高速互避,EPFL、港科大公开整套集群软硬件

洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。

洛桑联邦理工学院、香港科技大学等
文章封面
2609.11775 具身智能与机器人

不用强化学习,ETH灵巧手18秒学会指内握笔,误差0.6毫米

苏黎世联邦理工学院软体机器人实验室提出一套实时控制方法,让灵巧手只靠手指转动握住的笔,不用强化学习、仿真训练或预采集演示。控制器在笔记本CPU上约18秒完成初始化,实体手多次书写的平均平面误差为0.6毫米;速度提高后误差会明显变大。

苏黎世联邦理工学院等
文章封面
2609.10915 具身智能与机器人

机器人不再走走停停:IMLE-VLA把动作推理从15Hz拉到55Hz

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院等
文章封面
2609.11499 视觉与生成

一张图让AI递归搭世界,乔治亚理工把3D场景直接写成代码

乔治亚理工学院提出Recursive Code World Models,让视觉语言编程智能体从一张参考图生成可执行3D场景代码。它先搭整体,再递归进入局部补建筑和关系,最后回到全局修边界;中世纪村落实验的PSNR从16.8升到19.0,但

乔治亚理工学院等
文章封面
2609.10943 视觉与生成

Adobe给AI导演补了近10万镜头课,生视频前先把运镜写清楚

Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指

Adobe Research、伍斯特理工学院等
文章封面
2609.11507 视觉与生成

视频里多个主角总串脸?阿里、北大把身份相似度拉高31.2%

阿里巴巴、北京大学提出DIAL,从视频扩散模型内部找出能定位参考主体的注意力图,用它在推理时调节保真强度,并在训练时自动构造偏好样本。Kaleido骨干上的FaceSim从43.80%升至57.46%,相对提高31.2%;评测基于180条提

阿里巴巴、北京大学等
文章封面
2609.10811 视觉与生成

Adobe给AI修图画了三种线:白色必改,灰色可改,黑色别动

Adobe Research、威廉与玛丽学院提出Overpainting,用白、灰、黑三值蒙版告诉AI哪些像素必须修改、可以修改和绝对不能动。它既能保护背景,又允许模型在物体边缘补足上下文;结果来自研究原型和用户实验,并非Adobe商业软件

Adobe Research、威廉与玛丽学院等
文章封面
2609.11929 大模型

8B模型直出4K图,SenseNova-U1.5把看图和生图塞进一套架构

论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公

论文公开页面未披露作者机构
文章封面
2609.11274 大模型

小米让AI在多人吵成一团时只听你,真实会议词错率20.63%

小米ASR团队提出Xiaomi-CocktailASR-1,用一段参考语音当“声纹提示词”,从多人重叠声音中只转写目标说话人;目标人没开口时,模型应输出空文本。它在AliMeeting远场测试的词错率为20.63%,但论文没有说明这项能力已

小米等
文章封面
2609.11042 Agent

腾讯T1终端智能体硬刚GPT-5.4,300多步工具调用不掉链

腾讯Hy基础模型前沿团队、新加坡国立大学等机构提出T1,让122B混合专家模型在真实云端终端里连续调用工具300多步。它在Terminal-Bench 2.1上解决64.0%的任务,同一测试框架下高于GPT-5.4的54.8%;测试在隔离沙

腾讯Hy基础模型前沿团队、新加坡国立大学等
文章封面
2609.09396 视觉与生成

英伟达测17个视觉模型:固定摄像头最难看懂时间

英伟达、克莱姆森大学研究团队发布VANTAGE-Bench,用3346个媒体素材零样本评测17个视觉语言模型,场景覆盖仓库、交通和智慧空间。结果不是“工业视频全面更难”:视频问答和二维指点差距较小,缺口集中在事件验证、指代表达与时间定位;其

英伟达、克莱姆森大学等
文章封面
2609.10346 AI基础设施

只加0.017%参数,多模态AI准确率相对涨26.9%

新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Gr

新加坡国立大学、Cardinal AI Lab、香港科技大学等
文章封面
2609.09163 大模型

给小模型造60个代码世界,准确率猛涨29个百分点

Quome、华盛顿大学等机构提出“世界时间计算”:把领域规则写成可执行程序,自动生成带精确答案的训练轨迹。0.5B模型在60个训练世界学习后,对20个未见世界的诊断准确率提高29个百分点;收益主要出现在符号状态和短步推理,像素任务、长链任务

Quome、华盛顿大学等
文章封面
2609.09410 Agent

网页会搜、SQL会写,顶级AI合起来却只过一半

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等
文章封面
2609.09989 大模型

AI连续答对也别急停:3520条省token规则全军覆没

香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单

香港科技大学、牛津大学等
文章封面
2609.09554 大模型

一个Whisper不够用?102个单语模型赢下77种语言

加州大学圣地亚哥分校、EleutherAI联合制作BuzzASR,为102种语言分别微调Whisper语音识别模型。各语言最优版本在77种语言上超过Whisper-large-v3,字符错误率平均降低超过2.8倍;比较集中在FLEURS和C

加州大学圣地亚哥分校、EleutherAI等
文章封面
2609.09338 AI基础设施

Together AI让229B大模型推理快17.5%

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.09394 视觉与生成

DeepMind一套模型吃遍普通、鱼眼和360度相机

Google DeepMind、苏黎世联邦理工学院联合提出OmniPoint,用一套权重处理普通透视、鱼眼和360度全景图,从单张图片恢复带真实尺度的三维点云。方法在多个基准上做零样本评测,还能接收相机内参或稀疏深度;这些成绩不等于所有镜头

Google DeepMind、苏黎世联邦理工学院等
文章封面
2609.10050 具身智能与机器人

伯克利把1500段AI视频变成灵巧手训练动作

加州大学伯克利分校、Sharpa Robotics、香港大学等机构提出GALATEA:先让视频模型生成手与物体的动作,再把画面重建成仿真可执行轨迹。团队落地超过1500段生成视频,仿真训练成功率较基线高出25个百分点以上,并做了真机闭环演示

加州大学伯克利分校、Sharpa Robotics、香港大学等
文章封面
2609.10137 具身智能与机器人

机器人一只手拧瓶盖,3种装配任务直接上真机

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等
文章封面