arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.27448 大模型

阿里&浙大提出TTPO:无标签测试时训练让Qwen3-1.7B从38.0%升至45.2%

模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。

浙江大学、阿里巴巴等
文章封面
2608.27456 Agent

美团&上交等打造UrbanGround:把AI智能体放进真实尺度城市

看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。

上海交通大学、美团、新加坡国立大学等
文章封面
2608.25872 具身智能与机器人

清华、南科大等让机器人看夹爪形变感知接触,抓取、拧盖和书法均获验证

拧瓶盖时,摄像头能看到机械臂位置,却很难判断软夹爪是否已经压紧;力和触觉传感器又会增加布线、标定和成本。清华大学、南方科技大学、哈尔滨工业大学提出VISTA-Policy,从合规夹爪的三维形变场中提取接触反馈。

清华大学、南方科技大学、哈尔滨工业大学等
文章封面
2608.25871 更多前沿

阿里、中科大等用3200万条商品轨迹训练CEDAR,让销量预测响应预算变化

商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。

阿里巴巴、中国科学技术大学、香港科技大学(广州)等
文章封面
2608.25659 具身智能与机器人

图灵智新、中科院自动化所等让机器人训练时学3D世界,实机成功率升至52.5%

机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。

图灵智新、中科院自动化所、清华大学等
文章封面
2608.25061 AI基础设施

IBM让大模型给数据库写GPU算子,22条查询全通过并加速2.11倍

数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内

IBM Research、维也纳工业大学等
文章封面
2608.25334 视觉与生成

阿里淘天、中科院大学提出GraftSR,用同款照片把超分纹理误差降低20.2%

低清商品图里的针织花纹已经糊成一片,生成式超分常会补出看似清晰、实际不存在的纹理。阿里淘天集团、中国科学院大学提出GraftSR,不让模型凭经验猜细节,而是读取同一件商品的另一张高清照片,把可确认的纹理移到目标位置。

阿里淘天集团、中国科学院大学等
文章封面
2608.25622 Agent

vivo、港中大(深圳)等让8B模型规划视频剪辑,得分从0.620升至0.924

“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每

港中大(深圳)、vivo AI Lab、北京大学等
文章封面
2608.25417 Agent

北大、清华、商汤让AI拿工具精细画图,25个模型相似度最高仅0.54

模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。

北京大学、清华大学、商汤研究院等
文章封面
2608.25479 视觉与生成

北大、腾讯混元提出4DStreamCtrl,单卡20 FPS实时控制视频镜头和物体

拖动一个物体的三维轨迹、改变相机运动,再让视频继续往后生成,过去通常要分给不同模型处理。北京大学、腾讯混元提出4DStreamCtrl,把相机、物体和深度都编码成三维点轨迹,在一次前向计算中完成联合控制。

北京大学、腾讯混元等
文章封面
2608.26058 具身智能与机器人

小米、澳门大学让一个模型控制多种机器人,LIBERO成功率98.3%

同一个“把面包拿起来”任务,单臂机器人、双臂机器人和人手使用的关节、控制器与动作维度完全不同。小米具身智能团队、澳门大学提出UCAG-P,把这些动作先换算成相机能观察到的手腕、末端执行器和抓取中心轨迹,再交给不同机器人的运动学模块执行。

小米具身智能团队、澳门大学等
文章封面
2608.24020 Agent

复旦、字节让AI边看工程图边修CAD代码,可执行率做到99.33%

从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。

复旦大学、字节跳动等
文章封面
2608.24777 Agent

上海AI实验室等提出StepGuard,智能体攻击成功率降77.3%、效用少2.8点

工具型智能体一旦执行发邮件、改文件或支付等操作,事后识别风险往往已经太晚。上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等机构提出StepGuard,在每次工具调用前检查动作,也能对完成后的整条轨迹做审计。

上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等
文章封面
2608.24876 Agent

普林斯顿、斯坦福等让智能体递归改记忆,37组长任务实验中35组成功率上升

智能体执行长任务时,聊天记录越来越长,未完成目标容易被淹没,检索到的技能也可能与当前状态错位。新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学提出Recuris,把工作记忆和经验记忆耦合,并让失败证据反向推动局部技能更新。

新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学等
文章封面
2608.23691 Agent

剑桥、港大等让AI智能体自由做数学,12道构造题里5道找到新结果

不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。

DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校等
文章封面
2608.23864 视觉与生成

复旦、阿里提出AffineTok,20轮训练把图像生成gFID降低26%

扩散模型先在视觉分词器的潜空间里去噪,再把潜变量解码成图像。分词器即使能高质量重建图片,也不一定让后续去噪容易。复旦大学、阿里巴巴提出AffineTok,把潜空间中的语义组织方式纳入训练目标。

复旦大学、阿里巴巴等
文章封面
2608.24119 视觉与生成

北大、商汤、浙大让AI看一组示例就学物理变化,覆盖74种图像变换

给AI一组“变化前—变化后”的图片,再给一张新图,让它照着示例完成同类编辑。现有视觉上下文学习擅长颜色、材质和外观迁移,却常忽略物体结构、相互作用和环境条件。北京大学、商汤研究院、浙江大学提出TransPhy,把任务拆成物理规则推断和结果渲

北京大学、商汤研究院、浙江大学等
文章封面
2608.24882 具身智能与机器人

清华等让机器人把“未来画面”压成潜动作,延迟降低42.9%

机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。

清华大学、中科院自动化所、TARS Robotics、复旦大学等
文章封面
2608.24674 视觉与生成

浙大、清华等把190亿参数音视频生成提速54.67倍,单张H20从318秒降到5.83秒

输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。

浙江大学、清华大学、新加坡国立大学等
文章封面