arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 275 篇

2605.30363 2026-08-04 q-fin.CP cs.AI cs.LG q-fin.ST 版本更新 62%

Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market

利用非结构化数据增强制度转换检测:国债市场研究

Mingxuan Yi, Vidal Mehra, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, UK(布里斯托大学工程数学与技术学院) Propellant Digital B.V., Amsterdam, Netherlands(荷兰阿姆斯特丹Propellant Digital公司) School of Mathematics, Cardiff University, UK(卡迪夫大学数学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合大语言模型推理与统计检验的文本增强型制度转换检测框架,在国债市场数据上实现F1=0.82,优于纯数据驱动方法。

Comments 9 pages, 4 figures. Selected for Long Oral presentation at the International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI 2026), Bremen, Germany, 15 August 2026 (non-archival). Code available at: https://github.com/mingxuan-yi/regime_shift

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15607 2026-08-04 cs.CL cs.LG 版本更新 62%

Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language

无语义的语法:教大语言模型在未见过的语言中编程

Vinayshekhar Bannihatti Kumar, Disha Makhija, Manoj Ghuhan Arivazhagan, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨大语言模型在未见过的语言中生成代码的能力,发现微调仅能教授语法而无法转移语义能力,揭示了推理与语言实现之间的鸿沟。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19321 2026-07-30 cs.AI cs.CR cs.LG 版本更新 62%

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

研究竞技场:评估自动化人工智能研发中的破坏行为与监控

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究针对自动化人工智能研发,用研究竞技场框架评估人工智能控制,通过四项长期任务及两类隐藏附带任务,评估前沿代理破坏与监控能力,发现训练数据中破坏行为难捕捉,发布框架用于评估自动化人工智能研发中的破坏与控制。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12250 2026-07-30 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

How memory can affect collective and cooperative behaviors in an LLM-Based Social Particle Swarm

记忆如何影响基于LLM的社会粒子群中的集体和合作行为

Taisei Hishiki, Takaya Arita, Reiji Suzuki

机构 * Graduate School of Informatics(信息学研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型代理的内部对齐特性如何影响记忆对其集体和合作动态的影响。通过将社会粒子群模型中的规则代理替换为具有大五人格特质和不同记忆长度的LLM代理,发现记忆长度是决定集体行为的关键参数,且不同模型对记忆的解读影响合作结果。

Comments 11 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09239 2026-07-28 cs.CL cs.LG 版本更新 62%

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

重复标记计数揭示了表示与输出之间的脱节

Sohan Venkatesh

机构 * Manipal Institute of Technology Bengaluru(班加罗尔Manipal理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型在重复标记计数任务中表现不佳,但通过线性探针发现错误源于多层感知机块的固定错误覆盖,而非表示层的缺陷。

Comments Code is available at https://github.com/sohv/counting-failure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01335 2026-07-28 cs.CL cs.AI 版本更新 62%

LEDOM: Reverse Language Model

LEDOM:反向语言模型

Xunjian Yin, Sitao Cheng, Yuxi Xie, Xinyu Hu, Li Lin, Xinyi Wang, Liangming Pan, William Yang Wang, Xiaojun Wan

机构 * Peking University(北京大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Arizona(亚利桑那大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LEDOM是一种反向自回归语言模型,通过反向训练获得独特能力,如演绎推理和解决反转诅咒,并在多个基准测试中提升了性能。

Comments Work in progress; Models can be found at: https://huggingface.co/Corning/Reverse-Model-7B-348B/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09504 2026-07-24 cs.CR cs.AI cs.LG 版本更新 62%

AI Security Policy Should Assess Systems, Not Only Models

位置:AI安全政策应针对系统,而非模型

Michael A. Riegler, Inga Strümke

机构 * AI Safety Department(人工智能安全部门) SimulaMet and OsloMet(SimulaMet和奥斯陆计量)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 62%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00821 2026-07-23 cs.AI cs.CL cs.IR 版本更新 62%

Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory

逐字块胜过提取的人工制品:长LLM对话中记忆表征的控制消融研究

Tao An

机构 * Hawaii Pacific University(夏威夷太平洋大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过控制消融实验,发现逐字对话块在长对话记忆检索中比LLM提取的结构化人工制品(事实、决策等)准确率高15.9-22.0点,原因是提取过程丢失了逐字细节,而结构化记忆应作为逐字文本的补充而非替代。

Comments v4: title and abstract aligned with ARR August 2026 submission; six confound controls; 34 pages, 6 figures. Code: https://github.com/tao-hpu/cog-canvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03691 2026-07-22 cs.SE cs.AI cs.LG 版本更新 62%

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

不要责怪大语言模型:脚手架演化如何塑造编码代理质量

Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

机构 * Queen’s University Canada(加拿大女王大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16051 2026-07-21 cs.CL cs.AI 版本更新 62%

Loop the Loopies!

循环循环者!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 62%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02522 2026-07-21 cs.CL cs.LG 版本更新 62%

Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR

通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法

Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13162 2026-07-20 cs.CL cs.AI 版本更新 62%

What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors

模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型

Winston Zeng, Ali Emami, Jinho D. Choi

机构 * Emory University(埃默里大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04593 2026-07-20 cs.IR cs.AI cs.CL 版本更新 62%

Ruling Out to Rule In: Contrastive Hypothesis Retrieval for Medical Question Answering

排除谬误以确认正确:面向医疗问答的对比假设检索

Byeolhee Kim, Min-Kyung Kim, Young-Hak Kim, Tae-Joon Jeon

机构 * Asan Medical Center(峨山医疗中心) Yonsei University(延世大学) University of Ulsan College of Medicine(蔚山大学医学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对比假设检索框架CHR,通过生成正确和错误假设来提升医疗问答系统检索效果,实验显示在多个基准测试中优于现有方法,有效减少硬负样本污染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 62%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12466 2026-07-16 cs.CV cs.AI cs.LG 版本更新 62%

Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

Inverse-LLaVA:通过文本到视觉映射重新思考多模态对齐

Xuhui Zhan, Tyler Derr

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究重新审视多模态学习中传统映射方向,提出Inverse-LLaVA架构,通过文本到视觉映射反转方向。该架构无需对齐预训练,在多模态基准测试中展现强大学习效率,为多模态架构设计开辟新方向,解耦表示结构与监督方式。

Comments 19pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07155 2026-07-14 cs.LG cs.AI 版本更新 62%

Stable On-Policy Distillation through Adaptive Target Reformulation

通过自适应目标重述实现稳定的在线策略蒸馏

Ijun Jang, Jewon Yeom, Juan Yeo, Hyunggyu Lim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Veto方法,通过在logit空间构建几何桥梁,解决传统在线策略蒸馏中的分布不匹配问题,提升训练稳定性与输出多样性。

Comments 10 pages, 5 figures, Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14761 2026-07-08 cs.LG cs.AI cs.CV 版本更新 62%

Universal Algorithm-Implicit Learning

通用算法隐式学习

Stefano Woerner, Seong Joon Oh, Christian F. Baumgartner

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07364 2026-07-08 cs.AI cs.LG 版本更新 62%

Base Models Know How to Reason, Thinking Models Learn When

基础模型知道如何推理,思维模型在训练中学习时机

Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究思维语言模型训练中比基础模型多学到了什么,提出无监督方法和建设性模型差异分析,通过九个基础/思维模型对实验发现强化学习教编排基础机制启发式,监督微调蒸馏装新机制,为训练范式及推理模型开发提供新视角。

Comments Accepted as a Spotlight at the International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 62%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17484 2026-07-07 cs.CL cs.LG 版本更新 62%

Learning When to Attend: Conditional Memory Access for Long-Context LLMs

学习何时关注:为长上下文LLM的条件记忆访问

Sakshi Choudhary, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Matthew Trager, Wei Xia, Stefano Soatto

机构 * Department of Electrical and Computer Engineering, Purdue University, USA(电子工程系,普渡大学,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出L2A方法,通过条件性长程记忆访问提升长上下文LLM性能,使Qwen 2.5和Qwen 3模型的有效上下文长度从32K扩展到128K,同时提升训练效率并减少内存消耗。

Comments 26 pages, 11 Tables, 18 Figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新 62%

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.07645 2026-07-03 cs.HC cs.AI cs.CL 版本更新 62%

Playing 20 Question Game with Policy-Based Reinforcement Learning

基于策略的强化学习玩20个问题游戏

Huang Hu, Xianchao Wu, Bingfeng Luo, Chongyang Tao, Can Xu, Wei Wu, Zhan Chen

机构 * Peking University(北京大学) Microsoft Corporation(微软公司) Microsoft Development Co., Ltd(微软开发有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于策略的强化学习方法,使提问者通过与用户持续交互学习最优问题选择策略,并利用奖励网络估计信息奖励,无需知识库且对噪声答案鲁棒。

Comments Withdrawal from the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11061 2026-06-26 cs.LG cs.CL 版本更新 62%

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

虚假奖励悖论:从机制上理解RLVR如何在LLMs中激活记忆捷径

Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究RLVR中虚假奖励导致模型依赖记忆而非推理的机制,发现锚定-适配器电路,并通过因果干预验证其作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13077 2026-06-26 cs.CL cs.AI 版本更新 62%

Tuning Language Models by Mixture-of-Depths Ensemble

通过深度混合集成微调语言模型

Haoyan Luo, Lucia Specia

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MoDE框架,将后期层作为集成通过学习路由权重贡献最终logits,可在任何微调方法上应用,以较小参数开销提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07078 2026-06-23 cs.LG cs.AI 版本更新 62%

The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

最优Token基线:长程LLM-RL的方差缩减

Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00626 2026-06-19 cs.LG cs.CL 版本更新 62%

A Survey of On-Policy Distillation for Large Language Models

大型语言模型的在线策略蒸馏综述

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10635 2026-06-17 cs.AI cs.LG 版本更新 62%

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

OmniSapiens: 一种通过异质性感知相对策略优化进行社会行为处理的基础模型

Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Prince Sattam bin Abdulaziz University(普森·萨塔姆·本·阿卜杜勒阿齐兹大学) University of Rochester(罗切斯特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对行为数据异质性导致的训练不平衡问题,提出Omnisapiens-7B 2.0基础模型,采用异质性感知相对策略优化(HARPO)方法,在10个行为任务和5个零样本泛化基准上取得最佳性能。

Comments Accepted to ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏