arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2609.28258 具身智能与机器人

英伟达让机器人首见零件就会插,成功率从7%拉到56%

英伟达、加州大学圣迭戈分校、南加州大学做出了一套通用机器人插装世界模型。它用90种几何形状不同的零件训练,面对没见过的测试零件时,零样本成功率达56%,无模型基线只有7%。这类能力直接对应高混线上频繁换件的应用难题。

英伟达、加州大学圣迭戈分校、南加州大学等
文章封面
2609.24976 具身智能与机器人

机器人长出触觉神经!伯克利推出DexTacWAM,双臂灵巧操作准确率翻倍

加利福尼亚大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校与西北大学等机构联合推出具身视触觉世界模型DexTacWAM,赋予双臂灵巧机器人敏锐的指尖感知与物理预判能力。研究团队将预训练视频模型与触觉压缩技术结合,使机器人单任务仅需约百次示范即可

加利福尼亚大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校、西北大学等
文章封面
2609.22884 AI基础设施

128K长文本加速5倍还不掉点!清华阿里解耦注意力,路由开销仅3.4ms

处理数十万字超长上下文时,传统的全注意力计算开销随长度呈二次方暴涨,导致首字延迟与算力成本难以承受。清华大学联合阿里巴巴、中国科学技术大学与上海人工智能实验室等机构推出了免训练的解耦块稀疏注意力机制BSA。该机制将稀疏路由计算耗时压缩至3.

清华大学、阿里巴巴、中国科学技术大学、上海人工智能实验室等
文章封面
2609.24797 AI基础设施

解密并增强Kimi线性注意力:欧洲团队推出Complex KDA,外推能力大涨

线性注意力与RNN模型在长序列处理中具备恒定推理显存优势,但其隐藏状态更新受限于标量衰减,在复杂状态追踪上明显逊色于Transformer。弗莱堡大学联合微软研究院、图宾根大学与洛桑联邦理工学院等机构推出了复数域增量更新架构Complex

弗莱堡大学、微软研究院、图宾根大学、洛桑联邦理工学院等
文章封面
2609.22788 视觉与生成

视频模型假装懂物理?清华微软ECCV揭秘:准确率差1%但思考逻辑全错

视频大模型在画面生成中展现了逼真的动态效果,但其是否真正理解客观物理世界的运动法则始终存在广泛争议。清华大学联合面壁智能与微软等机构在ECCV深入揭示了视频基础模型在物理因果推理中的表面化捷径缺陷。评测表明模型表面准确率虽仅与人类相差1%,

清华大学、面壁智能、微软等
文章封面
2609.25001 大模型

腾讯打造首个AAA游戏AI基准:5000小时数据体检47个大模型

近年来多模态大模型在虚拟环境决策中取得飞速进展,但始终缺少针对商业级AAA游戏的标准化评测体系。腾讯ARC实验室联合大湾区大学、香港中文大学和新加坡国立大学等机构推出了首个GameHorizon评测套件,全面接入21款主流大作。研究团队通过

腾讯ARC实验室、大湾区大学、香港中文大学、新加坡国立大学等
文章封面
2609.23806 Agent

把AI扔进真实办公室,证据找到率从90.4%跌到74.5%

哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学提出WorkWorlds:先固定员工真正能访问的完整组织状态,再把任务交给智能体。192组匹配评估中,完整工作环境让证据访问率从90.4%降到74.5

哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学等
文章封面
2609.23466 Agent

AI换模型也不失忆:复旦阿里让长期记忆继续沿用

复旦大学、阿里巴巴通义应用业务组提出RPMem,把每次会话编译成独立于模型底座的潜在记忆,再递归合并并映射为LoRA参数。Qwen3-8B在PERMA上达到85.52%,比最强参数记忆和文本记忆基线高5.32和12.98个百分点。

复旦大学、阿里巴巴通义应用业务组等
文章封面
2609.24308 视觉与生成

世界模型一操作就露馅:31个系统接受交互可靠性体检

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等机构提出HappyWorld-Bench,把世界模型放进视频、空间和具身三条赛道。团队评测14个视频模型、9个空间系统和8个具身候选,重点检查交互后的状态保持与规则响应。

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等
文章封面
2609.22771 大模型

GPT-4o Audio只答对36%:新模型开始听懂语气和环境

Adobe Research、马里兰大学、OpenAI提出ParA-LLM,把语速、音高、口音、混响和背景噪声等22类特征放进同一套音频理解框架。6000题ParA-Bench中,GPT-4o-Audio约为36%,ParA-LLM总体达到

Adobe Research、马里兰大学、OpenAI等
文章封面
2609.24058 视觉与生成

一个OCR读懂229种语言,复旦腾讯把F1从65.71%拉到80.89%

复旦大学、腾讯微信视觉、华南理工大学提出ScriptMoE,用一个稀疏专家识别器覆盖10种文字体系、229种语言。它替换PP-OCRv5的识别模块后,在CC-OCR多语种任务上把F1从65.71%提高到80.89%,略高于最佳视觉语言模型的

复旦大学、腾讯微信视觉、华南理工大学等
文章封面
2609.22308 Agent

不给源码,只看画面:AI开始黑盒复刻25款游戏

中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院提出GameReplica:不给智能体源码、说明书或现成轨迹,只允许它看截图并操作目标游戏,再写出可运行复刻。基准含125项任务、25款受控游戏和5类核心机制。

中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院等
文章封面
2609.24981 视觉与生成

视频一转镜头就变形?腾讯把3D几何塞进生成底层

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校提出GAE,把3D几何直接放进生成模型的潜空间。同一份紧凑表示可解码画面、深度、相机和点云;在两个视频数据集上,FVD分别下降12.7%和23.1%。

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校等
文章封面
2609.21709 大模型

腾讯AI Lab&清华让大模型双向“说”手语,12名手语用户参与实测

清华大学、南洋理工大学、鹏城实验室与腾讯AI Lab提出SignGPT,用共享语言模型同时完成无gloss手语转文字和文字转手语。系统串起一轮手语对话,并邀请12名聋人美国手语使用者参与探索性评估,分别观察语义和动作体验。

清华大学、南洋理工大学、鹏城实验室、腾讯AI Lab等
文章封面
2609.21058 AI基础设施

AI写GPU内核快283倍?放进真实大模型,端到端只快约1%

论文公开页面未披露作者机构。研究重新检查AI生成GPU内核的正确性和真实工作负载占比:一个曾被计为283倍加速的内核只写入0.3%输出;即使替换可优化算子,Transformer端到端现实改善也约为1%,局部跑分不能直接代表整机收益。

论文公开页面未披露作者机构
文章封面
2609.22068 Agent

小米把3185个代码库变训练场,编程智能体五项基准全涨

小米、北京大学、香港大学和中国人民大学提出CodeMidas,只读取源码,就把3185个代码库转成5545项可执行训练任务,覆盖23种语言。使用这些环境训练后,MiMo-V2.5在论文选定的五项编程基准上均有提升,也减少了对现成工单的依赖。

小米、北京大学、香港大学、中国人民大学等
文章封面
2609.21967 大模型

英伟达把语音助手做成真对话:被打断100%接管,还能调用工具

英伟达推出NemotronLabs VoiceChat,把流式听、说、打断处理、反馈识别和工具调用放进统一语音架构。论文报告用户打断后的接管率为100%,短促反馈后恢复回答的比例为93%,工具选择F1达到82.5%,重点转向真实对话节奏。

英伟达等
文章封面
2609.20218 大模型

别急着用LLM做表格预测:只用约6%标签,经典模型就能反超

宾夕法尼亚大学研究者把“直接提示冻结小型GPT”与“收集标签训练经典模型”放到18个表格数据集上比较。观察到的性能交叉点中位数约为完整训练集的6%;在86%的案例里,手头已有标签量就足以让经典模型胜出,为企业表格预测给出一条可量化的选型线。

宾夕法尼亚大学等
文章封面
2609.20034 视觉与生成

单张L20跑实时世界模型,Astronex用5B参数硬刚百亿模型

Astronex Robotics和南京信息工程大学推出Astronex-World 1.0:输入文字或首帧后,用户可以持续控制相机、动作与角色类型,还能在生成中途插入事件。因果版以832×480、24fps输出,在一张NVIDIA L20

Astronex Robotics、南京信息工程大学等
文章封面
↑