arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.15810 AI基础设施

英伟达等把视频注意力压到低比特,工作站显卡最高快3.6倍

Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只

Nunchux AI、麻省理工学院、卡内基梅隆大学、英伟达等
文章封面
2609.14156 具身智能与机器人

UCLA把触觉画进画面,机器人实机成功率平均提升30个百分点

加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务

加州大学洛杉矶分校等
文章封面
2609.12872 大模型

AI陪聊也学会抢话:2000小时数据塞进打断、附和和环境声

作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐

作业帮等
文章封面
2609.13058 大模型

微软&清华换条专家路线,不加采样让Qwen推理再涨4.5点

微软研究院、清华大学提出ESRL,在混合专家模型后训练时直接探索不同专家路由,而不是只提高文本采样温度。Qwen3-30B-A3B上,平均Pass@1和Pass@8比GRPO提高3.2与4.5个百分点;结果来自指定数学推理基准,不能推断所有

微软研究院、清华大学等
文章封面
2609.12342 视觉与生成

人和动物共用一个动作模型,14.6万段动作跨过骨骼差异

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)等
文章封面
2609.12830 视觉与生成

给AI图片调情绪不换内容,3300组实验测住语义漂移

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等
文章封面
2609.12090 视觉与生成

视频AI记错了也能用?错误记忆竟保住94.1%收益

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院等
文章封面
2609.12658 视觉与生成

视频AI太爱抢答:6个系统里4个提前响应多过漏报

北京航空航天大学、阿里巴巴提出ProactiveBench,专门测试视频AI什么时候该开口。六个系统中有四个“提前响应”比“错过事件”更常见,比例从2.1倍到28倍;基准揭示的是受控视频任务中的时间判断,不等同于真实产品已造成同等风险。

北京航空航天大学、阿里巴巴等
文章封面
2609.12081 具身智能与机器人

清华等让机器人边走边拿,四项实机任务成功率76.3%

清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开

清华大学、Xspark AI、香港科技大学(广州)、香港大学等
文章封面
2609.12471 AI基础设施

AMD补齐CUDA之外的训练库:10万级内核数据喂给本地AI

AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定

AMD等
文章封面
2609.12433 具身智能与机器人

北大&银河通用让机器人学叠衣,纯合成训练实机成功率超90%

北大前沿计算研究中心、银河通用机器人提出FoldNet++,让双臂机器人只看合成演示就学会展开和折叠T恤,真机端到端成功率超过90%。这意味着难采、慢采的真实机器人数据有机会被大规模仿真替代;不过实验集中在T恤和受控桌面,不能直接外推到所有

北大前沿计算研究中心、银河通用机器人等
文章封面
2609.11382 具身智能与机器人

6架无人机高速互避,EPFL、港科大公开整套集群软硬件

洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。

洛桑联邦理工学院、香港科技大学等
文章封面
2609.11775 具身智能与机器人

不用强化学习,ETH灵巧手18秒学会指内握笔,误差0.6毫米

苏黎世联邦理工学院软体机器人实验室提出一套实时控制方法,让灵巧手只靠手指转动握住的笔,不用强化学习、仿真训练或预采集演示。控制器在笔记本CPU上约18秒完成初始化,实体手多次书写的平均平面误差为0.6毫米;速度提高后误差会明显变大。

苏黎世联邦理工学院等
文章封面
2609.10915 具身智能与机器人

机器人不再走走停停:IMLE-VLA把动作推理从15Hz拉到55Hz

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院等
文章封面
2609.11499 视觉与生成

一张图让AI递归搭世界,乔治亚理工把3D场景直接写成代码

乔治亚理工学院提出Recursive Code World Models,让视觉语言编程智能体从一张参考图生成可执行3D场景代码。它先搭整体,再递归进入局部补建筑和关系,最后回到全局修边界;中世纪村落实验的PSNR从16.8升到19.0,但

乔治亚理工学院等
文章封面
2609.10943 视觉与生成

Adobe给AI导演补了近10万镜头课,生视频前先把运镜写清楚

Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指

Adobe Research、伍斯特理工学院等
文章封面
2609.11507 视觉与生成

视频里多个主角总串脸?阿里、北大把身份相似度拉高31.2%

阿里巴巴、北京大学提出DIAL,从视频扩散模型内部找出能定位参考主体的注意力图,用它在推理时调节保真强度,并在训练时自动构造偏好样本。Kaleido骨干上的FaceSim从43.80%升至57.46%,相对提高31.2%;评测基于180条提

阿里巴巴、北京大学等
文章封面
2609.10811 视觉与生成

Adobe给AI修图画了三种线:白色必改,灰色可改,黑色别动

Adobe Research、威廉与玛丽学院提出Overpainting,用白、灰、黑三值蒙版告诉AI哪些像素必须修改、可以修改和绝对不能动。它既能保护背景,又允许模型在物体边缘补足上下文;结果来自研究原型和用户实验,并非Adobe商业软件

Adobe Research、威廉与玛丽学院等
文章封面
2609.11929 大模型

8B模型直出4K图,SenseNova-U1.5把看图和生图塞进一套架构

论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公

论文公开页面未披露作者机构
文章封面
↑