arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

共 139 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.19197 cs · cs.AI

华盛顿大学等提出SPADE:让智能体自己编环境,工具调用提升13.9分

固定训练题库会被智能体逐渐做熟,继续强化学习只是在重复已经会的任务。华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等机构提出SPADE,让同一个模型同时扮演“环境设计者”和“推理智能体”,生成可执行环境并随学习进度调整难度。

华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等
文章封面
2608.19098 cs · cs.AI

字节Seed、清华提出Open-MOPD:多教师能力恢复率升至83.4%

把数学、代码、指令遵循等多个强化学习专家蒸馏到一个学生模型,短答案任务可能先停滞,长答案领域却持续占用大部分Token更新。清华大学AIR、字节Seed提出Open-MOPD,在SmolLM3-3B-Base的受控实验中,把相对路由专家集合

清华大学AIR、字节Seed等
文章封面
2608.18852 cs · cs.AI

小红书、上交提出SkillGate:9B智能体成功率从40.8%升至53.2%

智能体先选对一个Skill文件,后续执行却失败,普通结果奖励会连同正确选择一起惩罚。上海交通大学、小红书提出SkillGate,把“选哪个Skill”和“拿Skill完成任务”分成两条互不重叠的信用通道。五项智能体基准上,9B策略的试验成功

上海交通大学、小红书等
文章封面
2608.18701 cs · cs.RO

清华等做了4000条视触觉演示,让机器人分清软面包和硬物体

机器人把面包放到目标位置,并不代表任务真的成功:抓得太松会滑落,抓得太紧会把软物体压坏,外部相机有时看不出两者差别。拓境智能、清华大学、卡内基梅隆大学等机构提出SoftVTBench,收集4000条视触觉演示,专门评估可变形物体操作中的形变

拓境智能、清华大学、卡内基梅隆大学等
文章封面
2608.18307 cs · cs.AI

同一个GPT-5 mini只换操作界面,成功率从83.1%跌到48.9%

GPT-5 mini操作同一批网页组件,只把观察与动作方式从无障碍树换成纯截图坐标,任务成功率就从83.1%降到48.9%。杜克大学、亚马逊AGI旧金山实验室提出ComponentBench,把按钮组、筛选表格、拖拽和富文本编辑器等97类组

杜克大学、亚马逊AGI旧金山实验室等
文章封面
2608.18593 cs · cs.CV

南京大学、vivo提出ReX-Shot:一张照片重选机位和焦距

照片已经拍完,还能向左换机位、拉长焦距、调高曝光,并让同一物体在所有新视角里保持一致。南京大学、vivo提出ReX-Shot,从一张参考图同时控制视角、连续焦距和色温、曝光、饱和度等摄影参数,论文系统达到接近实时的交互速度。

南京大学、vivo等
文章封面
2608.18114 cs · cs.AI

Meta等用无创脑信号解码完整句子,平均词错误率降至39%

九名参与者听到句子后在键盘上输入,脑磁图设备连续记录大脑活动。Meta AI、巴黎高师、法国国家科学研究中心等机构据此训练Brain2Qwerty v2,在不植入电极的情况下解码自然句子,跨参与者平均词错误率达到39%。

Meta AI、巴黎高师、法国国家科学研究中心等
文章封面
2608.19055 cs · cs.CV

迪士尼让AI鼓手跟着任意音乐演奏,鼓槌落点精确到厘米级

给系统一段真实音乐,它要决定什么时候抬手、哪根鼓槌打哪面鼓,还要让肩膀和躯干看起来像人在演奏。迪士尼研究工作室、特拉维夫大学、苏黎世联邦理工提出一套音频驱动的扩散模型,把身体自然度和鼓槌落点精度分开优化,生成动作可达到厘米级落点控制。

迪士尼研究工作室、特拉维夫大学、苏黎世联邦理工等
文章封面
2608.18234 cs · cs.AI

人形机器人踩空也能站稳:GigaBrain跌倒恢复率99.3%

人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回

论文公开页面未披露作者机构
文章封面
2608.19182 cs · cs.AI

英伟达ADEPT训练灵巧手:五次实验全部闯到最高难度

五指机械手要完成插销,得先找到物体、抓稳、在手中调整方向,再把它对准孔位。英伟达、密歇根大学提出ADEPT:先用通用“物体重定向”任务预训练,再用一套稳定后训练方案学习具体操作。论文的Kuka-Allegro插销实验中,五个随机种子全部训练

英伟达、密歇根大学等
文章封面
2608.17027 cs.RO

UCLA等让人形机器人边走边抓:15万条仿真轨迹训练,实机成功率73.3%

让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。

加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等
文章封面
2608.17420 cs.CV

清华&长城汽车等提出SPVC:修好跨数据集驾驶视频里的结构错位

自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾

清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等
文章封面
2608.17253 cs.AI · cs.CV

不用标准答案也能练推理?字节等提出Co-RL,多智能体互评最高提升8.6%

没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。

埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等
文章封面
2608.17271 cs.AI

人类撤掉方法指导,AI科研得分近乎腰斩:清华等发布ASI-Bench

给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。

清华大学、麻省理工学院、哈佛大学、微软研究院等
文章封面
2608.17528 cs.AI · cs.SE

微软等发布Agent Lightning 1.0:6000条样本把编程智能体提升14.6个百分点

训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型

微软、复旦大学、浙江大学、爱丁堡大学等
文章封面
2608.18034 cs.CV

浙大&上交提出DAS:让智能体闭环写综述,30个主题总分拿下4.34

自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。

浙江大学、上海交通大学等
文章封面
2608.17995 cs.CV

阿里云&上交等提出AViTS:只放大关键Token,扩散模型最高加速14.76倍

扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。

上海交通大学、山东大学、阿里云、西安交通大学等
文章封面
2608.18077 cs.RO

英伟达等提出Hydra-0:把机器人动作变成像素流,运动误差降低90.4%

机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。

英伟达、布朗大学、哥伦比亚大学、哈佛大学等
文章封面