arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.37686 Agent

AI会操作电脑了?一进专业工程软件,多软件任务只成功3.6%

清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实

清华大学、智曼公司、北京大学、浙江大学等
文章封面
2609.37690 视觉与生成

视频越长,记忆却不涨:哈佛把世界模型塞进6张固定平面

哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealE

哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等
文章封面
2609.37989 Agent

Google让Agent自己改数据流水线,51个表格任务直接包揽前五

Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方

Google Research、南加州大学、Google DeepMind、哈佛大学等
文章封面
2609.38166 AI基础设施

大模型长文本卡在“状态读写”:8比特量化把内核提速3.7倍

加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。

加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等
文章封面
2609.36851 自动驾驶

小鹏给世界模型装上“测谎仪”:自动驾驶安全违规少了27.6%

香港中文大学(深圳)、小鹏汽车、西安电子科技大学等机构提出RoXDrive,让自动驾驶策略只从“听指令”的世界模型片段中学习。它在nuScenes上把DiffusionDrive的安全违规减少27.6%,并在超过13万段场景的内部数据上持续

香港中文大学(深圳)、小鹏汽车、西安电子科技大学等
文章封面
2609.38172 具身智能与机器人

几段真人视频喂出搬运工:人形机器人没做实机微调也能搬箱子

亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。

亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等
文章封面
2609.36416 具身智能与机器人

双臂机器人自己拆任务:4万段轨迹把成功率从32%推到100%

Scale AI、Hugging Face、南加州大学、斯坦福大学等机构联合提出新方法,把双臂机器人的长任务拆成可预测的下一步,并公开4万多段密集标注轨迹。新策略在论文设定的空间消歧任务中把成功率从32%提高到100%,还把未见长任务的成功

Scale AI、Hugging Face、南加州大学、斯坦福大学等
文章封面
Forbes/Anna Tong 更多前沿

不崩老头崩Nerd!硅谷“科技宅伴游”一小时3500美元

今年6月,《福布斯》报道了硅谷AI圈的一门小众生意:几位高价伴游者既提供亲密陪伴,也能和客户聊AI、生物黑客、加密货币。曾在金融业工作的Meida Marek向记者报出每小时3500美元的价格;她说,近来不少客户来自英伟达。技术热潮里,有人

封面
2609.31507 具身智能与机器人

港科大NeurIPS 2026打造无人机长程导航基准:11.8万航迹覆盖18城,卫星视角直通实机

香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距

香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等
文章封面
2609.30749 Agent

港大NUS实测大模型跨库代码迁移:顶尖Claude项目级翻译仅33%成功,意图增强破局

香港大学、新加坡国立大学、香港中文大学(深圳)等机构推出ORCA,专门测试大模型能否把数据科学代码从一个软件库迁移到另一个库,同时保持结果正确。论文不仅测短代码片段,还测完整项目。在项目级任务中,受测的Claude-Opus-4.6成功率为

香港大学、新加坡国立大学、香港中文大学(深圳)等
文章封面
2609.31323 具身智能与机器人

MIT颠覆传统机械手抓取:闭眼摸索就能稳稳拿捏,3000种物体盲抓成功率95%

麻省理工学院、首尔大学、延世大学等机构提出一套“先看到位置、再靠手感抓稳”的机器人方案。机械臂仍可用视觉把手带到物体附近,但真正接触和收拢手指时,手部策略只读自身关节与驱动反馈,不再依赖物体图像或姿态估计。在包含3028种物体的仿真测试中,

麻省理工学院、首尔大学、延世大学等
文章封面
2609.30887 Agent

上交阿里通义搞定手机AI智能体:告别一步一步慢速点屏,深层链接直达成功率暴涨268%

上海交通大学与阿里巴巴通义实验室等机构提出GUI-Hopper,让手机AI助手在适合时使用应用的深层链接,直接打开目标页面,而不必每次都从首页逐层点击。团队先从应用中找出可能的入口,再用真机核验链接会落到哪里,并保留普通点屏操作作为兜底。在

上海交通大学、阿里巴巴等
文章封面
2609.30594 具身智能与机器人

伯克利DeepMind让大模型写全身策略:人形机器人自主穿门推箱,成功率达100%

加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务

加州大学伯克利分校、上海科技大学、Google DeepMind等
文章封面
2609.31225 具身智能与机器人

CMU与IIT把变阻抗装进ACT:机械臂擦拭震颤暴降180倍,精密操作终于不硬怼

意大利理工学院与卡耐基梅隆大学等机构提出Imp-ACT,让机械臂不仅学会“手该走到哪里”,也学会碰到物体时“该有多硬、多会让”。操作者演示任务时,系统同步记录动作与自动调节的刚度,再用ACT一起学习。在论文的擦拭实验中,接触力震颤相对高刚度

意大利理工学院、卡耐基梅隆大学等
文章封面
2609.30436 自动驾驶

港科大地平线攻克端到端智驾瓶颈:规划算力直降30.5%,驾驶评分还更高

香港科技大学、地平线、香港中文大学、南开大学等机构提出WALT,让自动驾驶规划器更好地利用视觉世界模型已经学到的道路信息。它先把行车轨迹转成紧凑的内部表示,再与路况画面的表示对齐,而不是直接让模型吐出一串坐标。在NAVSIM评测中,规划计算

香港科技大学、地平线、香港中文大学、南开大学等
文章封面
2609.30963 视觉与生成

清华京东拯救僵硬数字人:推翻模式坍塌魔咒,流式动作动态度狂飙45%

清华大学、京东、东南大学等机构提出Routed Forcing,想解决实时数字人常见的“嘴在动,身体却像木头”的问题。团队发现,压缩视频生成模型时,动作丰富度主要在人物身体区域流失,于是只在需要的位置和训练阶段加入真实视频示范。在两套实验数

清华大学、京东、东南大学等
文章封面
2609.30934 视觉与生成

上交清华破解AI视频造假难题:不仅能揪出伪造像素,还能把破绽讲明白

上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等机构提出ManiVid,让视频取证从“判断真假”进一步走向“标出哪里被改、说明为什么可疑”。研究团队构建约3.8万段带标注的篡改视频,并在专门测试中提升篡改区域定位和异常解释成绩。面

上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等
文章封面
2609.31382 大模型

北大百度清华搞定长文本推理:14B小模型干翻27B,Token开销狂砍75%

北京大学、百度、清华大学等机构提出H2S,让模型读长材料时先找出与问题有关的证据,再把证据压缩成一份短摘要后作答。在论文的长文本测试中,14B模型平均得分32.60,比受测的27B基线高10.17分;把输出预算从16K缩到4K时,仍保留97

北京大学、百度、清华大学等
文章封面
2609.28660 具身智能与机器人

伯克利让机器人偷师人手:300次真机试验零样本成功率89.3%

加州大学伯克利分校提出形态测量模仿框架,先把人手动作跨手形重定向到机械手上并保持接触,再用残差强化学习补齐动力学差异,最后蒸馏成视觉运动策略。仅用3双手、10段手物交互视频,就在300次真机试验、30个未见物体上取得89.3%的零样本成功率

加州大学伯克利分校等
文章封面
↑