AI会操作电脑了?一进专业工程软件,多软件任务只成功3.6%
清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实
清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实
哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealE
Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方
加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。
香港中文大学(深圳)、小鹏汽车、西安电子科技大学等机构提出RoXDrive,让自动驾驶策略只从“听指令”的世界模型片段中学习。它在nuScenes上把DiffusionDrive的安全违规减少27.6%,并在超过13万段场景的内部数据上持续
亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。
Scale AI、Hugging Face、南加州大学、斯坦福大学等机构联合提出新方法,把双臂机器人的长任务拆成可预测的下一步,并公开4万多段密集标注轨迹。新策略在论文设定的空间消歧任务中把成功率从32%提高到100%,还把未见长任务的成功
今年6月,《福布斯》报道了硅谷AI圈的一门小众生意:几位高价伴游者既提供亲密陪伴,也能和客户聊AI、生物黑客、加密货币。曾在金融业工作的Meida Marek向记者报出每小时3500美元的价格;她说,近来不少客户来自英伟达。技术热潮里,有人
当地时间2026年9月28日,Anthropic发布Claude Sonnet 5.5,即日起上线Claude应用、Claude Code、API及主流云平台。新模型主打日常编码与文档表格制作,输出提速30%以上,单任务开销较上代最多降30
香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距
香港大学、新加坡国立大学、香港中文大学(深圳)等机构推出ORCA,专门测试大模型能否把数据科学代码从一个软件库迁移到另一个库,同时保持结果正确。论文不仅测短代码片段,还测完整项目。在项目级任务中,受测的Claude-Opus-4.6成功率为
麻省理工学院、首尔大学、延世大学等机构提出一套“先看到位置、再靠手感抓稳”的机器人方案。机械臂仍可用视觉把手带到物体附近,但真正接触和收拢手指时,手部策略只读自身关节与驱动反馈,不再依赖物体图像或姿态估计。在包含3028种物体的仿真测试中,
上海交通大学与阿里巴巴通义实验室等机构提出GUI-Hopper,让手机AI助手在适合时使用应用的深层链接,直接打开目标页面,而不必每次都从首页逐层点击。团队先从应用中找出可能的入口,再用真机核验链接会落到哪里,并保留普通点屏操作作为兜底。在
加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务
意大利理工学院与卡耐基梅隆大学等机构提出Imp-ACT,让机械臂不仅学会“手该走到哪里”,也学会碰到物体时“该有多硬、多会让”。操作者演示任务时,系统同步记录动作与自动调节的刚度,再用ACT一起学习。在论文的擦拭实验中,接触力震颤相对高刚度
香港科技大学、地平线、香港中文大学、南开大学等机构提出WALT,让自动驾驶规划器更好地利用视觉世界模型已经学到的道路信息。它先把行车轨迹转成紧凑的内部表示,再与路况画面的表示对齐,而不是直接让模型吐出一串坐标。在NAVSIM评测中,规划计算
清华大学、京东、东南大学等机构提出Routed Forcing,想解决实时数字人常见的“嘴在动,身体却像木头”的问题。团队发现,压缩视频生成模型时,动作丰富度主要在人物身体区域流失,于是只在需要的位置和训练阶段加入真实视频示范。在两套实验数
上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等机构提出ManiVid,让视频取证从“判断真假”进一步走向“标出哪里被改、说明为什么可疑”。研究团队构建约3.8万段带标注的篡改视频,并在专门测试中提升篡改区域定位和异常解释成绩。面
北京大学、百度、清华大学等机构提出H2S,让模型读长材料时先找出与问题有关的证据,再把证据压缩成一份短摘要后作答。在论文的长文本测试中,14B模型平均得分32.60,比受测的27B基线高10.17分;把输出预算从16K缩到4K时,仍保留97
加州大学伯克利分校提出形态测量模仿框架,先把人手动作跨手形重定向到机械手上并保持接触,再用残差强化学习补齐动力学差异,最后蒸馏成视觉运动策略。仅用3双手、10段手物交互视频,就在300次真机试验、30个未见物体上取得89.3%的零样本成功率