arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.20519 Agent

英伟达MIT联手造出SoL-Pi:AI写代码Token直降49%,成本暴砍三分之一

英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将To

英伟达、麻省理工学院、南洋理工大学等
文章封面
2609.20818 视觉与生成

水花飞溅也能3D定格!谷歌微软联合打造SplashSplat,高斯泼溅攻克流体重建

谷歌、苏黎世联邦理工学院与微软等机构联合推出流体动态三维重建框架SplashSplat,攻克了高速飞溅液体难以高保真建模的视觉难题。研究团队采用7台同步4K相机阵列采集真实流体数据,通过观测驱动的几何约束与动态三维高斯泼溅技术,精准还原液体

谷歌、苏黎世联邦理工学院、微软等
文章封面
2609.24976 具身智能与机器人

机器人长出触觉神经!伯克利推出DexTacWAM,双臂灵巧操作准确率翻倍

加利福尼亚大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校与西北大学等机构联合推出具身视触觉世界模型DexTacWAM,赋予双臂灵巧机器人敏锐的指尖感知与物理预判能力。研究团队将预训练视频模型与触觉压缩技术结合,使机器人单任务仅需约百次示范即可

加利福尼亚大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校、西北大学等
文章封面
2609.23153 AI基础设施

单卡加速265倍!北大清华阿里打造SparkDiffusion,5090秒级跑Wan2.1

北京大学、清华大学与阿里巴巴集团等机构联合推出视频扩散加速方案SparkDiffusion,攻克了长视频生成中的计算瓶颈。研究团队针对Wan2.1开源大模型设计动态稀疏路由与误差自校准机制,在保持画面完整的前提下剔除多达97%的冗余计算。单

北京大学、清华大学、阿里巴巴集团等
文章封面
2609.22884 AI基础设施

128K长文本加速5倍还不掉点!清华阿里解耦注意力,路由开销仅3.4ms

处理数十万字超长上下文时,传统的全注意力计算开销随长度呈二次方暴涨,导致首字延迟与算力成本难以承受。清华大学联合阿里巴巴、中国科学技术大学与上海人工智能实验室等机构推出了免训练的解耦块稀疏注意力机制BSA。该机制将稀疏路由计算耗时压缩至3.

清华大学、阿里巴巴、中国科学技术大学、上海人工智能实验室等
文章封面
2609.24197 AI基础设施

小模型KV缓存直接砍掉!哈佛英伟达推出H-Spec,投机解码显存归零

投机解码能大幅加快大模型推理,但传统方案中草稿模型保留的KV缓存占据了宝贵显存,在高并发服务下极易引发显存枯竭。哈佛大学联合第一资本、红帽公司与英伟达等机构推出了全新投机解码框架H-Spec。该架构将草稿模型的KV缓存彻底归零,同时将平均T

哈佛大学、第一资本、红帽公司、英伟达等
文章封面
2609.24797 AI基础设施

解密并增强Kimi线性注意力:欧洲团队推出Complex KDA,外推能力大涨

线性注意力与RNN模型在长序列处理中具备恒定推理显存优势,但其隐藏状态更新受限于标量衰减,在复杂状态追踪上明显逊色于Transformer。弗莱堡大学联合微软研究院、图宾根大学与洛桑联邦理工学院等机构推出了复数域增量更新架构Complex

弗莱堡大学、微软研究院、图宾根大学、洛桑联邦理工学院等
文章封面
2609.22966 具身智能与机器人

不用专用数据也能操纵机械臂!清华腾讯用单样本让VLM成功率飙至73.6%

利用通用多模态大模型控制机械臂通常需要收集成千上万条昂贵的机器人专业轨迹进行专门微调。清华大学联合腾讯混元等机构研发了免微调离散动作映射架构RoboDawn。该系统仅凭单次自然动作示范与原生指令接口,便将现成大模型在物理机械臂上的操作成功率

清华大学、腾讯混元等
文章封面
2609.23407 具身智能与机器人

机器人学会“听声辨位”:北大阿里清华推出首个具身空间声学大模型

具身智能机器人以往高度依赖前向摄像头视觉,在暗光视线受阻或转角盲区场景下极易丧失对目标的追踪定位。北京大学联合阿里巴巴与清华大学等机构联合推出了首个具身空间声学大模型OmniEcho。该模型赋予智能体感知三维声场与实时双耳声源定位的能力,在

北京大学、阿里巴巴、清华大学等
文章封面
2609.22788 视觉与生成

视频模型假装懂物理?清华微软ECCV揭秘:准确率差1%但思考逻辑全错

视频大模型在画面生成中展现了逼真的动态效果,但其是否真正理解客观物理世界的运动法则始终存在广泛争议。清华大学联合面壁智能与微软等机构在ECCV深入揭示了视频基础模型在物理因果推理中的表面化捷径缺陷。评测表明模型表面准确率虽仅与人类相差1%,

清华大学、面壁智能、微软等
文章封面
2609.24840 具身智能与机器人

端到端16.79毫秒跑进机载算力!哈工大清华让动作扩散人形机敏捷抗推

动作扩散策略为机器人带来极佳的柔顺控制与多模态泛化,但其高昂计算开销难以满足双足人形机器人的机载实时性要求。哈尔滨工业大学联合上海创新研究院、清华大学与上海交通大学等机构研发了轻量化动作预测扩散架构PredActor。该策略在低算力机载芯片

哈尔滨工业大学、上海创新研究院、清华大学、上海交通大学等
文章封面
2609.24952 自动驾驶

NASA毅力号实机数据跑通AI越野:火星漫游车防陷通行准确率破87%

深空漫游车在松软异星土壤中极易发生车轮下陷打滑,依赖人工延时干预严重限制了探索范围与移动效率。南加州大学联合NASA喷气推进实验室与华盛顿州立大学等机构推出了面向火星行驶的端到端自监督通行评估模型。该系统在毅力号真实火星车跨越500个火星日

南加州大学、NASA喷气推进实验室、华盛顿州立大学等
文章封面
2609.22829 具身智能与机器人

人形机器人全身操作新突破:手持示范零遥操,宇树G1成功率达90%

人形机器人实现全身协调操作长期依赖昂贵笨重的全身外骨骼遥操设备,严重制约了技能采集效率。浙江大学联合香港具身智能实验室、Mondo Robotics与香港中文大学等机构推出了全套低成本全身技能迁移框架Whole-Body UMI。该方案仅凭

浙江大学、香港具身智能实验室、Mondo Robotics、香港中文大学等
文章封面
2609.25001 大模型

腾讯打造首个AAA游戏AI基准:5000小时数据体检47个大模型

近年来多模态大模型在虚拟环境决策中取得飞速进展,但始终缺少针对商业级AAA游戏的标准化评测体系。腾讯ARC实验室联合大湾区大学、香港中文大学和新加坡国立大学等机构推出了首个GameHorizon评测套件,全面接入21款主流大作。研究团队通过

腾讯ARC实验室、大湾区大学、香港中文大学、新加坡国立大学等
文章封面
2609.23806 Agent

把AI扔进真实办公室,证据找到率从90.4%跌到74.5%

哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学提出WorkWorlds:先固定员工真正能访问的完整组织状态,再把任务交给智能体。192组匹配评估中,完整工作环境让证据访问率从90.4%降到74.5

哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学等
文章封面
2609.23466 Agent

AI换模型也不失忆:复旦阿里让长期记忆继续沿用

复旦大学、阿里巴巴通义应用业务组提出RPMem,把每次会话编译成独立于模型底座的潜在记忆,再递归合并并映射为LoRA参数。Qwen3-8B在PERMA上达到85.52%,比最强参数记忆和文本记忆基线高5.32和12.98个百分点。

复旦大学、阿里巴巴通义应用业务组等
文章封面
2609.24308 视觉与生成

世界模型一操作就露馅:31个系统接受交互可靠性体检

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等机构提出HappyWorld-Bench,把世界模型放进视频、空间和具身三条赛道。团队评测14个视频模型、9个空间系统和8个具身候选,重点检查交互后的状态保持与规则响应。

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等
文章封面
2609.22771 大模型

GPT-4o Audio只答对36%:新模型开始听懂语气和环境

Adobe Research、马里兰大学、OpenAI提出ParA-LLM,把语速、音高、口音、混响和背景噪声等22类特征放进同一套音频理解框架。6000题ParA-Bench中,GPT-4o-Audio约为36%,ParA-LLM总体达到

Adobe Research、马里兰大学、OpenAI等
文章封面
↑