arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.16409 视觉与生成

AI推理不只写草稿,还会先画图:六项视觉任务最高提升25%

达姆施塔特工业大学提出ReImaGin,让多模态模型遇到空间问题时先生成一张中间图,再根据这张图回答。它可以移除遮挡、连接轨迹,或把多个房间视角整理成平面图。在多视角空间判断、碰撞预测等六项任务上,这条“先画再想”的路线超过纯文字推理和固定

达姆施塔特工业大学等
文章封面
2609.16372 大模型

微软让AI清空草稿继续推理,只留少量记忆代码成绩涨19.5分

微软研究院、威斯康星大学麦迪逊分校、加州大学圣迭戈分校提出注册令牌,让扩散语言模型跨段推理时不必一直保留全部草稿。模型写完一段就清除文字,只把少量固定位置的隐藏状态传给下一段。在LLaDA和Dream实验中,这种连续记忆在所有主要基准超过文

微软研究院、威斯康星大学麦迪逊分校、加州大学圣迭戈分校等
文章封面
2609.16255 大模型

900条样本、单卡不到2小时,2B视频模型反超大四倍对手

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校等
文章封面
2609.16251 Agent

AI会点鼠标却做不好CAD:200项任务领先智能体只过17.5%

佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等机构推出CADWorld,把七个电脑智能体送进FreeCAD完成200项机械设计任务。任务覆盖11类工作流,结果不看它点了多少按钮,而是直接检查保存文件的尺寸、约束、结构和制造状态。领先智

佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等
文章封面
2609.16443 具身智能与机器人

MIT、斯坦福给机器人造了60多个逼真跑酷考场,专测真实部署前翻车

南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等机构推出Neverwhere,把超过60个真实室内外场景重建成可闭环运行的机器人考场。视觉运动控制器能在部署前反复接受台阶、沟槽和障碍测试,失败条件也能复现。论文还发现,只靠3D高斯

南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等
文章封面
2609.16683 具身智能与机器人

清华让人形机器人边走边干活,41个关节协同成功率92.5%

清华大学、大连理工大学、香港中文大学提出Weave,让人形机器人从人类示范学习边走、边保持平衡、边用双手操作物体。策略同时控制29个身体关节和12个手指关节,在九种物体的训练交互上成功率达到92.5%,无需额外训练执行未见序列时达到65.0

清华大学、大连理工大学、香港中文大学等
文章封面
2609.16034 大模型

StepAudio把AI音乐拉到5分30秒,先写编曲计划再生成整首歌

阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校提出StepAudio 3 Music,把“先编曲、再出声音”写进音乐生成流程。模型支持歌曲、器乐、干声配伴奏和翻唱,单次长度最长5分30秒。中间的ABC记谱计划让和声、节奏和旋律结构进入生

阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校等
文章封面
2609.16995 Agent

牛津、斯坦福给论文装上AI医生,30篇草稿诊断一致率70.6%

牛津大学、斯坦福大学、新加坡国立大学等机构提出PaperDoctor,让AI不再只给论文打分,而是定位原文、解释问题并给出修改方案。30篇在写论文的作者共评估1299条反馈,对其中证据判断的接受率为70.6%。这套系统还会检查代码和按优先级

牛津大学、斯坦福大学、新加坡国立大学等
文章封面
2609.13269 视觉与生成

不用AI分类器也能抓准翻手瞬间:240段干扰动作零误报

独立研究者提出一种几何手势检测法,把张开手掌绕长轴翻转写成单个标量的过零事件,无需分类器、训练数据或用户校准。带精确真值的实验中,它检出95%的翻转,对240段相似干扰动作零误报,并把时刻定位到平均6.7毫秒;方法只适用于这一类动作且依赖上

独立研究者等
文章封面
2609.13947 AI基础设施

视觉数据压低18816倍,传感器还没出片就先做计算

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学和德州大学奥斯汀分校提出OASIS,让传感器附近的小编码器先提取任务信息再传输。特定视觉唤醒模型配置把数据量压到原始8比特图像的1/18816,系统能耗降低约2至4.5倍;部分芯片结果来自仿

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学、德州大学奥斯汀分校等
文章封面
2609.13251 视觉与生成

微软让AI扩图别乱改主角,主体误差平均降10.8%

微软与弗吉尼亚理工大学提出主体清晰度外扩框架,专门处理人物、车辆或文字被裁掉一部分的难题。它用视觉语言提示确认主角,再以多尺度小波监督补回局部细节;四套基准上,相比各数据集最强方法,主体误差平均降10.8%,结果仍取决于原图与主体类型。

微软、弗吉尼亚理工大学等
文章封面
2609.15369 大模型

AI文章换词也藏不住?看结构仍能做到98.1 F1

Sitefire提出SlopShape,不盯AI偏爱的单词,而是检查信息顺序、证据使用和语气等文章结构。它在268家公司、13500篇英文商业博客上,仅凭187个结构特征取得98.0宏F1,模型自行改写后仍为98.1;结果不能直接外推到中文

Sitefire等
文章封面
2609.15503 视觉与生成

苏黎世联邦理工造了100万张假文档,专治拍照弯曲和阴影

苏黎世联邦理工学院发布SyntheticDoc,用物理模拟与路径追踪生成100万张高分辨率文档训练样本,覆盖弯曲、折叠、褶皱和复杂光照。数据同时给出UV图、法线、反照率与阴影等像素级标注;但它仍是合成数据,跨真实手机和纸张的表现要以实测为准

苏黎世联邦理工学院等
文章封面
2609.15128 大模型

画面先骗人、声音后纠错:新方法让流式多模态模型别急着下结论

香港大学、香港科技大学(广州)、萨塞克斯大学和LIGHTSPEED提出Omni-Streaming Thinking,让实时音视频模型把早期判断先标成待验证,而不是立刻当事实。冻结Qwen3-Omni骨干并加轻量适配后,它在五项基准上相对最

香港大学、香港科技大学(广州)、萨塞克斯大学、LIGHTSPEED等
文章封面
2609.15570 具身智能与机器人

机器人预测未来只用一步,DIDO在LIBERO成功率做到99%

中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人

中科院自动化所、智源研究院、西安交通大学、亚马逊等
文章封面
2609.15810 AI基础设施

英伟达等把视频注意力压到低比特,工作站显卡最高快3.6倍

Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只

Nunchux AI、麻省理工学院、卡内基梅隆大学、英伟达等
文章封面
2609.14156 具身智能与机器人

UCLA把触觉画进画面,机器人实机成功率平均提升30个百分点

加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务

加州大学洛杉矶分校等
文章封面
2609.12872 大模型

AI陪聊也学会抢话:2000小时数据塞进打断、附和和环境声

作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐

作业帮等
文章封面
↑