arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 713 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 145 篇

2608.01672 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Learning What to Remember: Test-Time Training via Context Distillation

学习该记住什么:基于上下文蒸馏的测试时训练

Zixuan Wang, Xingyu Dang, Rui-Jie Zhu, Zixin Wen, Hengyu Fu, Wenhao Chai, Jason D. Lee

机构 * Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有测试时训练未考虑保留信息未来效用的问题,提出TTCD框架及IP-TTCD变体,实验显示其在长上下文语言建模任务中性能优于多个基准方法,可助力架构持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01638 2026-08-04 cs.CV 新提交 67%

Dynamic Resolution Routing for Efficient Egocentric Grounding

面向高效自我中心 grounding 的动态分辨率路由

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01189 2026-08-04 cs.SE 新提交 67%

MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment

MADE:用于自主模型部署的信念驱动双智能体协调机制

Yicheng Liu, Bolin Zhang, Weiran Liu, Yakun Zhang, Yangqin Jiang, Zhiying Tu, Dianhui Chu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00650 2026-08-04 cs.DB 新提交 67%

TEngineDB-V: An OLAP-Native Vector Search System for Large-$k$ Workloads at Tencent

TEngineDB-V:腾讯面向大k workloads的原生OLAP向量搜索系统

Xufei Wu, Pengcheng Zhang, Yitong Song, Xiaobo Zhang, Anqi Liang, Kai Wang, Jijun Du, Yidi Xiong, Guangxu Cheng, Zhe Chen, Peng Chen, Guoliang Li, Xuanhe Zhou, Fan Wu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出TEngineDB-V,一款腾讯的原生OLAP向量搜索系统,通过全局分块解耦索引等技术解决大k向量搜索问题,实验显示其性能较竞品最高提升145倍,适配百亿级生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00458 2026-08-04 cs.MA 新提交 67%

BANDMAS: Causality-Inspired Semantic Packet Scheduling for Bandwidth-Efficient Multi-Agent Collaboration

BANDMAS:面向带宽高效多智能体协作的因果启发式语义分组调度

Jiangwen Dong, Wanyu Lin

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体协作中通信流量大、开销高的问题,提出BANDMAS框架,通过因果启发式语义分组调度减少应用层流量,在三类数据集上实现了显著的流量降低并取得最优任务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23509 2026-08-04 cs.SE 版本更新 67%

Uncovering Business Logic Bugs via Semantics-Driven Unit Test Generation

通过语义驱动的单元测试生成揭示业务逻辑错误

Chen Yang, Junjie Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出SeGa方法,通过语义知识库生成单元测试以发现业务逻辑错误,实验显示其在检测错误数量和精度提升方面优于现有技术。

Comments Accepted in the Research Track of ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 67%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新 67%

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

专题命中 效率与部署 :language model(abstract);pretraining(abstract)

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01400 2026-08-04 cs.LG cs.AI 新提交 66%

TabDPT-Turbo: Efficient In-Context Learning for Tabular Prediction

TabDPT-Turbo:面向表格预测的高效上下文学习方法

Rasa Hosseinzadeh, Alex Labach, Zexin Xue, Shuyi Han, Valentin Thomas, Anthony L. Caterini

专题命中 效率与部署 :foundation model(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出TabDPT-Turbo模型,通过结合基于行的注意力、长上下文预训练及SSL预训练,在保持与TabDPT v1.1相当性能的同时大幅提升推理速度,是当前最快的表格预测基础模型。

Comments Presented as a poster at the non-archival ICML workshop on Foundation Models for Structured Data (FMSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02365 2026-08-04 cs.AI cs.LG cs.RO 新提交 62%

Faster-WAM: Do World Action Models Need Deep Action Modules?

Faster-WAM:世界动作模型需要深度动作模块吗?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Celia Team(华为Celia团队) Labs(2012实验室)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01422 2026-08-04 cs.CL cs.LG 新提交 62%

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

QR-Erase:基于子空间的高效机器遗忘方法,结合层定位技术

Tyler Lizzo, Larry Heck

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出QR-Erase框架,结合层定位技术实现高效机器遗忘,在多类遗忘任务中取得优于优化方法的权衡效果,为基础模型提供了SVD的高效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00737 2026-08-04 cs.LG cs.AI cs.PF 新提交 62%

An Embedded RISC-V Evaluation of Kolmogorov--Arnold Networks in Hard-Constrained Recurrent Physics-Informed Models

硬约束循环物理信息模型中柯尔莫哥洛夫-阿诺德网络的嵌入式RISC-V评估

Enzo Nicolas Spotorno, Josafat Leal Filho

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文在RISC-V嵌入式平台上评估硬约束循环物理信息模型的KAN残差分支,发现其部署时延迟和能耗高于MLP,量化后可靠性更差,不适合作为默认选择。

Comments 6 pages, submitted to SBESC 2026 as an extension to the ICLR Workshop Paper https://openreview.net/forum?id=iHpbQn99RB

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00301 2026-08-04 cs.LG cs.CL 新提交 62%

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案

Xujun Che, Yuchen Yuan, Weida Zhao, Chenyang Yu

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07050 2026-08-04 cs.CL cs.LG 版本更新 62%

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

多教师在线策略蒸馏中的行为杠杆不平衡

Jiabin Shen, Guang Chen, Chengjun Mao

机构 * AntGroup(蚂蚁集团)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多教师在线策略蒸馏中行为杠杆不平衡问题,提出Soft Clamp方法,通过校准令牌级散度,减少模型过度调用工具情况,在保持决策准确率的同时,降低工具调用循环和重复调用,提升多教师OPD效果。

Comments 33 pages, 5 figures. Code and aggregate artifacts: https://github.com/shen-jiabin/topk-support-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21848 2026-08-04 cs.CL cs.AI 版本更新 62%

Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

无键注意力:面向高效Transformer的值空间路由与仅值缓存

Xin Gao, Xingming Xu

机构 * York University(约克大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出无键注意力机制,通过消除键投影并仅使用查询和值,实现50%的KV缓存减少,同时匹配或超越标准注意力的解码吞吐量,并在多个模型上达到相当或更优的困惑度与下游任务性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08696 2026-08-04 cs.CL cs.LG 版本更新 62%

Structured Recurrent Mixers for Massively Parallelized Sequence Generation

结构化递归混合器用于大规模并行序列生成

Benjamin L. Badger

机构 * IBM

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种结构化递归混合器架构,能够在训练时实现序列并行表示与推理时的递归表示之间的代数转换,从而在不依赖专用内核或设备特定内存管理的情况下提高训练效率、输入信息容量和推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06741 2026-08-04 cs.LG cs.AI cs.CV 版本更新 62%

Heterogeneous Decentralized Diffusion Models

异构去中心化扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * bagel.com(Bagel公司)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种异构去中心化训练框架,通过支持不同专家使用不同目标(DDPM和Flow Matching)并统一推理、预训练检查点转换以及高效架构,大幅降低计算和数据需求,使单GPU(24-48GB VRAM)即可参与训练。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04923 2026-08-04 quant-ph cs.AI cs.LG 62%

Artificial intelligence for representing and characterizing quantum systems

Yuxuan Du, Yan Zhu, Yuan-Hang Zhang, Min-Hsiu Hsieh, Patrick Rebentrost, Weibo Gao, Ya-Dong Wu, Jens Eisert, Giulio Chiribella, Dacheng Tao, Barry C. Sanders

机构 * College of Computing Data Science, Nanyang Technological University, Singapore 639798, Singapore Computation Initiative, Department of Computer Science, The University of Hong Kong, Pokfulam Road, Hong Kong Department of Physics, University of California, San Diego, La Jolla, CA 92093, USA Hon Hai (Foxconn) Research Institute, Taipei, Taiwan Centre for Quantum Technologies, National University of Singapore Department of Computer Science, National University of Singapore School of Electrical \& Electronic Engineering, Nanyang Technological University, Singapore 639798, Singapore John Hopcroft Center for Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China Dahlem Center for Complex Quantum Systems, Freie Universitat Berlin, 14195 Berlin, Germany Department of Computer Science, Parks Road, Oxford, OX1 3QD, United Kingdom Perimeter Institute for Theoretical Physics, Waterloo, Ontario N2L 2Y5, Canada Institute for Quantum Science Technology, University of Calgary, Alberta T2N 1N4, Canada

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

Comments 32 pages. Comments are welcome

Journal ref Nature Reviews Physics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02351 2026-08-04 cs.AI 新提交 57%

KC-Agent: A Dual-Process Cognitive Architecture for Efficient ML Model Improvement

KC-Agent:用于高效机器学习模型改进的双进程认知架构

Gusseppe Bravo-Rocca, Jordi Guitart, Ajay Dholakia, David Ellison, Puneet Jain

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 KC-Agent是一种双进程认知架构,结合快速模式识别与审慎增量更新,在五组数据集评估中,以最优效率和领先性能优于现有认知架构,可高效应对真实世界数据漂移场景。

Comments Accepted at IEEE COMPSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02032 2026-08-04 cs.LG 新提交 57%

DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

DART:用于高效长上下文序列建模的循环状态解码注意力

Yixiao Qian, Song Chen, Pengkai Wang, Jiaxu Liu, Shengze Cai, Chao Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) School of Science, Huzhou Normal University(湖州师范学院理学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 DART基于Mamba-2的状态空间对偶性,通过保留分块状态记忆并解码键值执行状态-记忆注意力,减少长上下文推理缓存,同时提升关联召回与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01998 2026-08-04 cs.DC cs.AI cs.NI 新提交 57%

TALSC: Timeliness-Aware Large-Small VLM Collaboration for Infrastructure-Assisted Autonomous Driving

TALSC:面向基础设施辅助自动驾驶的时效性感知大小视觉语言模型协作

Mengmeng Zhu, Yuxuan Sun, Wei Chen, Bo Ai

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对基础设施辅助自动驾驶中VLM协作的时效性问题,提出TALSC框架,通过李雅普诺夫漂移加估计惩罚算法优化调度,在nuScenes仿真中较最优基线实现Micro-F1最高12.6%的归一化提升。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01359 2026-08-04 cs.CL 新提交 57%

EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

EviSD:面向搜索增强智能体的证据条件自蒸馏

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

机构 * Ant Group(蚂蚁集团) NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL

AI总结 该研究针对搜索增强智能体的轨迹级信用问题,提出EviSD证据条件自蒸馏框架,在7个问答基准及3种骨干模型上,其宏观平均精确匹配优于最强对比方法1.3-2.3个百分点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00714 2026-08-04 cs.CV cs.AI 新提交 57%

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

面向视频理解的覆盖驱动型自适应关键帧选择

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00345 2026-08-04 cs.CV cs.AI 新提交 57%

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

ORCA:面向无需训练的3D CT视觉令牌压缩的器官质心聚合方法

Renjie Liang, Zijian Xu, Jinqian Pan, Chengkun Sun, Zhengkang Fan, Shawn Li, You Qin, Mei Liu, Jie Xu

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对3D CT视觉令牌压缩的痛点,提出无需训练的即插即用ORCA方法,在多数据集、多任务上实现显著压缩比与速度提升,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00264 2026-08-04 cs.CV cs.AI 新提交 57%

Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

视觉Transformer中可解释性引导的注意力头软剪枝

Kamil Książek, Piotr Suszyński, Michał Jan Włodarczyk, Jacek Tabor, Przemysław Biecek

机构 * University of Warsaw(华沙大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 该研究针对视觉基础模型架构庞大的问题,提出可解释性引导的注意力头软剪枝框架SAPER,在ImageNet-1K上实现了优于RAPTOR的精度-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26246 2026-08-04 cs.LG 版本更新 57%

Weak-to-Strong On-Policy Distillation

弱到强在线策略蒸馏

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

机构 * University of Maryland(马里兰大学) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.LG

AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20785 2026-08-04 cs.RO cs.AI 版本更新 57%

Robostral Navigate

稳健导航

Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sade, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amelie Heliou, Amos You, Andre Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Antonia Calvi, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Avinash Sooriyarachchi, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Roziere, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Blazej Osinski, Camille Le Scao, Chaoran Yu, Charlotte Cronjager, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clemence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Etienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaetan Ecrepont, Gaetan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hedi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Josephine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Leo Cotteleer, Leonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Maarten Buyl, Manon Chossegros, Marcin Mozejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poiree, Mathieu Schmitt, Mathilde Guillaumin, Matthieu Andre, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Maximilian Augustin, Maximilian Muller, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michal Pietruszka, Michal Zajac, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Riviere, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomene Chagniot, Pierre Stock, Pierre-Andre Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Remi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Theo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothee Lacroix, Tobias Kronlachner, Tom Bewley, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Mace, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladiere, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 研究旨在解决大规模导航系统部署问题,提出Robostral Navigate模型,仅用单目RGB图像流预测路点,具鲁棒性。通过模拟场景减少对真实数据依赖,用前缀缓存训练等方法,在基准测试中达新最优,提升导航系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31449 2026-08-04 cs.LG stat.ML 版本更新 57%

Contextual Slate GLM Bandits with Limited Adaptivity

有限自适应性下的上下文式板GLM赌博机

Tanmay Goyal, Sukruta Prakash Midigeshi, Gaurav Sinha

机构 * Microsoft Research India(微软研究院印度)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 针对有限自适应性的上下文式板赌博机问题,提出两种算法B-SlateGLinCB和RS-SlateGLinCB,分别适用于批处理和少切换设置,在多样性假设下实现与非线性参数无关的遗憾界,并具有计算效率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27814 2026-08-04 cs.AI 版本更新 57%

ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks

ATOD: 面向多轮自主智能体的退火轮次感知在线策略蒸馏

Qitai Tan, Zefang Zong, Mo Li, Yipeng Shi, Yang Li, Peng Chen

机构 * Tencent Inc.(腾讯公司) Tsinghua University(清华大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 提出ATOD混合在线蒸馏算法,通过退火式OPD-RL调度和轮次级重加权,解决长程交互任务中OPD性能天花板和RL早期低效问题,在三个基准上超越教师模型。

详情

展开后加载摘要…

URL PDF HTML 收藏