arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

共 149 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.17027 cs.RO

UCLA等让人形机器人边走边抓:15万条仿真轨迹训练,实机成功率73.3%

让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。

加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等
文章封面
2608.17420 cs.CV

清华&长城汽车等提出SPVC:修好跨数据集驾驶视频里的结构错位

自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾

清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等
文章封面
2608.17253 cs.AI · cs.CV

不用标准答案也能练推理?字节等提出Co-RL,多智能体互评最高提升8.6%

没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。

埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等
文章封面
2608.17271 cs.AI

人类撤掉方法指导,AI科研得分近乎腰斩:清华等发布ASI-Bench

给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。

清华大学、麻省理工学院、哈佛大学、微软研究院等
文章封面
2608.17528 cs.AI · cs.SE

微软等发布Agent Lightning 1.0:6000条样本把编程智能体提升14.6个百分点

训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型

微软、复旦大学、浙江大学、爱丁堡大学等
文章封面
2608.18034 cs.CV

浙大&上交提出DAS:让智能体闭环写综述,30个主题总分拿下4.34

自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。

浙江大学、上海交通大学等
文章封面
2608.17995 cs.CV

阿里云&上交等提出AViTS:只放大关键Token,扩散模型最高加速14.76倍

扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。

上海交通大学、山东大学、阿里云、西安交通大学等
文章封面
2608.18077 cs.RO

英伟达等提出Hydra-0:把机器人动作变成像素流,运动误差降低90.4%

机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。

英伟达、布朗大学、哥伦比亚大学、哈佛大学等
文章封面
2608.15555 cs.CV · cs.LG

剑桥RigidBench测8款视频模型:没有一个在10项物理指标上全面领先

剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89

剑桥大学等
RigidBench用包含多个刚体的场景检查视频模型物理运动
2608.14783 cs.CV · cs.GR

上海AI Lab复旦中科大等让AI生成300零件3D物体,序列最长25.6万Token

上海人工智能实验室、复旦大学和中国科学技术大学等机构联合提出MegaParts,用自回归大模型生成由语义零件组成的3D物体。系统支持最多300个部件、最长25.6万Token序列,生成的门、抽屉、钢琴键等部件保持独立,便于后续移动、替换和制

上海人工智能实验室、复旦大学、中国科学技术大学等
MegaParts生成包含大量可编辑零件的复杂3D物体
2608.15265 cs.AI

腾讯港科广等让AI从一句话搭3D世界,GPT-5.5等成功率仍低于60%

香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%

香港科技大学(广州)、腾讯等
VibeWorlding智能体调用3D工具构建可交互世界
2608.16717 cs.CV

腾讯优图上交等发布PersonaShot:AI视频画面再漂亮,也会在切镜后忘记人物状态

上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。

上海交通大学、腾讯优图实验室、浙江大学等
PersonaShot展示AI多镜头视频中的物体、情绪和空间连续性错误
2608.14652 cs.AI · cs.CV

阿里达摩院南大等做0.1度天气预测,72小时内85%以上时段胜过IFS-HRES

南京大学、蚂蚁集团和阿里巴巴达摩院联合提出BaguanHR,目标是训练0.1度全球高分辨率天气模型。论文报告,在72小时预报范围内,其合成加真实数据版本在超过85%的受测时段优于IFS-HRES;训练数据翻倍时,72小时预报RMSE下降4.

南京大学、蚂蚁集团、阿里巴巴达摩院等
BaguanHR与机器学习模型及IFS-HRES在极端天气指标上的比较
2608.14718 cs.CL · cs.CV

蚂蚁清华等发布VideoGAIA:GPT-5.5等前沿模型看视频答题仍低于60%

香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确

香港中文大学、蚂蚁集团、清华大学等
VideoGAIA比较单轮视频问答与多轮智能体式视频理解
2608.15917 cs.AI · cs.CV

斯坦福MIT等用VR一周采集75小时数据,灵巧手只需1—2小时真机示范

斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。

斯坦福大学、麻省理工学院、Scale AI等
SPD从VR仿真预训练迁移到真实灵巧手操作
2608.16885 cs.RO

智元等提出τ0-VLA:用40115小时真实数据训练,机器人遇到难题可先多想几步

上海创新研究院、智元Finch和香港中文大学联合提出τ0-VLA,让机器人在决定下一项子任务时按难度分配推理计算:简单步骤直接执行,困难或后果重要的步骤先生成多个候选,再借助世界模型比较。模型使用40115小时异构真实世界数据训练,并在多种

上海创新研究院、智元Finch、香港中文大学等
τ0-VLA执行长流程机器人操作任务