arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 325 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 42 篇

2605.18077 2026-06-02 cs.AI cs.LG cs.MA 62%

LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

LLM引导的通信用于合作多智能体强化学习

Sangjun Bae, Yisak Park, Sanghyeon Lee, Seungyul Han

机构 * KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出LMAC框架,利用大语言模型的推理能力设计通信协议,使所有智能体尽可能准确一致地重建底层状态,从而提升多智能体强化学习中的状态重建和性能。

Comments 9 pages for main, 32 pages for total, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14405 2026-06-02 cs.LG cs.AI 62%

ES-Merging: Biological MLLM Merging via Embedding Space Signals

ES-Merging: 通过嵌入空间信号进行生物多模态大模型合并

Wonbin Lee, Dongki Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ES-Merging框架,利用嵌入空间信号估计合并系数,实现生物多模态大模型的高效合并,提升跨模态推理和单模态知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08026 2026-06-02 cs.CL cs.AI cs.PF 62%

DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention

DyLLM: 基于显著性标记选择与部分注意力的高效扩散LLM推理

Younjoo Lee, Seungkyun Dan, Junghoo Lee, Jaiyoung Park, Jung Ho Ahn

机构 * University of Seoul(首尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型迭代去噪计算昂贵的问题,提出DyLLM框架,通过仅计算显著标记的注意力与前馈操作,实现无需训练的加速推理,在保持精度的同时吞吐量提升高达9.6倍。

Comments 21 pages, 10 figures, 7 tables, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19919 2026-06-02 cs.CL cs.AI cs.SD 62%

ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition

ASKD-Whisper: 自适应自知识蒸馏用于高效低延迟自动语音识别

Junseok Lee, Nahun Kim, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Co., Ltd(OKESTRO公司) Sejong University(世宗大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应自知识蒸馏(ASKD)动态课程框架,通过逐步减少对教师模型的依赖并引入自知识蒸馏阶段,在压缩Whisper模型时实现5倍推理加速和1.07%词错误率降低。

Comments Title and content have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00615 2026-06-02 cs.AI cs.CL 62%

ACON: Optimizing Context Compression for Long-horizon LLM Agents

ACON:面向长周期LLM智能体的上下文压缩优化

Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

机构 * University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ACON框架,通过自然语言空间优化压缩策略,在不微调模型的情况下减少峰值token使用量26-54%并提升任务成功率,同时可蒸馏至小模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02528 2026-06-02 cs.AI cs.LG 62%

Multimodal Function Vectors for Visual Relations

视觉关系的多模态函数向量

Shuhao Fu, Esther Goldberg, Ying Nian Wu, Hongjing Lu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过因果中介分析提取多模态函数向量,操纵注意力头以改善视觉关系推理,并实现零样本和微调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02289 2026-06-02 cs.CL 57%

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

DECK: LLM幻觉的一致性×置信度分类法

Mohit Singh Chauhan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一种基于样本间一致性和词级置信度的2×2分类法(DECK),将LLM幻觉分为四个行为区域,每个区域对应可检测的评分器家族,并通过实验验证其有效性及识别出输出级不确定性评估的普遍盲点。

Comments 18 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01779 2026-06-02 cs.CL 57%

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge:面向自适应智能体系统的协同框架与策略进化

Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出HarnessForge元自适应框架,通过框架-策略协同进化实现LLM智能体系统的全系统自适应,在多个基准上显著提升性能。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01737 2026-06-02 cs.AI 57%

TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination

TrafficRAG:用于交通事故责任认定的多模态RAG框架

Xu Li, Zedong Fu, Xinyi Li, Xun Han

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出TrafficRAG框架,通过视觉语言模型生成结构化描述、混合检索获取法规和案例、大语言模型融合多模态证据进行推理,实现自动化交通事故责任分析报告生成。

Comments 12 pages, 3 figures, accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01441 2026-06-02 cs.AI 57%

Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

深入歧义:基于A*的多智能体常识混淆攻击LLM提示

Boxuan Wang, Zhuoyun Li, Xiaowei Huang, Yi Dong

机构 * University of Liverpool(利物浦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种基于A*的事实错误诱导框架,通过层次化重写策略和动态语义分散系数生成语义对齐但混淆的提示,以高效攻击LLM的常识推理。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01351 2026-06-02 cs.AI 57%

Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems

识别你的编排器:面向LLM多智能体系统的熵动力学视角

Junze Zhu, Weihao Chen, Xuanwang Zhang, Zhen Wu, Xinyu Dai

机构 * Junze Zhu, Weihao Chen, Xuanwang Zhang, Zhen Wu, Xinyu Dai(朱俊泽、陈伟浩、张轩望、伍震、戴新宇)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出平均场熵动力学框架,通过逆工作流生成(IWG)合成高复杂度基准,揭示推理型模型作为编排器时因上下文压缩而失效的“推理陷阱”,为多智能体系统架构设计提供物理可解释参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00683 2026-06-02 cs.CL 57%

OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

OCC-RAG:面向忠实问答的最优认知核心

Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

机构 * OCC Team(OCC团队)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出OCC-RAG,一种通过多上下文多跳合成数据训练的小语言模型,在忠实问答任务中匹配或超越2-6倍规模通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00440 2026-06-02 cs.AI 57%

SDR: Set-Distance Rewards for Radiology Report Generation

SDR:用于放射学报告生成的集合距离奖励

Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对胸部X光报告生成中标准奖励不兼容的问题,提出基于集合距离的连续置换不变奖励,通过GRPO后训练和测试时缩放显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00390 2026-06-02 cs.CV cs.AI 57%

Zamba2-VL Technical Report

Zamba2-VL 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24828 2026-06-02 cs.AI 57%

Test-Time Deep Thinking to Explore Implicit Rules

测试时深度思考以探索隐式规则

Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Renmin University of China(中国人民大学) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) School of Computer Science and Engineering, UESTC(UESTC计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Whiting School, Johns Hopkins University(约翰斯·霍普金斯大学惠特林学院) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对智能体在隐式规则环境中失败的问题,提出TTExplore框架,通过训练专用模型Exp-Thinker进行测试时推理,平均提升基线性能14-19点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05179 2026-06-02 cs.CL 57%

From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations

从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释

Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha

机构 * TCS Research(TCS研究) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布) University of Innsbruck(因斯布鲁克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对印地语等低资源语言的虚假信息检测,提出一种结合直接偏好优化(DPO)与课程学习的框架,通过引入“实际性”和“精炼度”参数优化解释质量,实验验证了生成连贯、相关解释的有效性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18877 2026-06-02 cs.LG 57%

RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models

RefLoRA:重构低秩适配以实现大型模型的高效微调

Yilang Zhang, Bingcong Li, Georgios B. Giannakis

机构 * Department of ECE University of Minnesota(电子工程系明尼苏达大学) Department of CS ETH Zürich(计算机科学系苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 针对LoRA因非唯一低秩分解导致权重更新不一致和性能下降的问题,提出RefLoRA方法,通过每步优化最小化损失上界的低秩分解,促进更平坦的损失景观和稳定收敛,在自然语言理解和常识推理任务上优于现有LoRA变体且计算开销可忽略。

Comments Accepted as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01837 2026-06-02 cs.CR 50%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 其他推理 :reasoning(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01745 2026-06-02 cs.SI 50%

Enhancing the Socioeconomic Understanding of Foundation Models with Urban Mobility

利用城市流动性增强基础模型的社会经济理解

Baoshen Guo, Donghang Li, Zhiqing Hong, Kailai Sun, Heye Huang, Alok Prakash, Shenhao Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 提出MobFusion范式,通过将流动性网络作为上下文、图连接器和结构化令牌三种方式融入基础模型,以提升城市社会经济预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01581 2026-06-02 cs.MA 50%

Agent System Operations: Categorization, Challenges, and Future Directions

智能体系统运维:分类、挑战与未来方向

Zexin Wang, Changhua Pei, Yuanhao Liu, Jingjing Li, Yintong Huo, Quan Zhou, Haotian Si, Hang Cui, Zihan Liu, Gaogang Xie, Fei Sun, Dan Pei, David Lo

专题命中 其他推理 :reasoning(abstract)

AI总结 本文针对大型语言模型(LLM)驱动的智能体系统在运行中出现的异常问题,提出了一种名为AgentOps的运维框架,涵盖监控、异常检测、根因定位和修复四个关键阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01097 2026-06-02 cs.CV 50%

Dual-Route Top-K Retrieval with 1v1 VLM Reranking for the CoVR-R

双路Top-K检索与1v1 VLM重排序用于CoVR-R

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Opus AI Research(Opus AI研究) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出双路Top-K检索与1v1 VLM重排序方法,通过解耦召回与选择,在CoVR-R挑战中达到95.28% R@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00712 2026-06-02 cs.CV 50%

CASTLE2026 Team WDL Technical Report

CASTLE2026 团队 WDL 技术报告

Zhengyang Li, Zhenglin Du, Yi Wen, Fang Liu, Shuo Li, Xu Liu

机构 * Key Laboratory of Intelligent Perception and Image Understanding(智能感知与图像理解重点实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出基于 Qwen 的证据感知多模态推理流程,通过提示路由和置信度加权投票解决长视频问答,在 CASTLE 挑战赛中排名第一。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10691 2026-06-02 cs.CY cs.CE cs.HC 50%

The Conversational Exam: A Scalable Assessment Design for the AI Era

对话式考试:AI时代的可扩展评估设计

Lorena A. Barba, Laura Stegner

专题命中 其他推理 :reasoning(abstract)

AI总结 针对学生使用生成式AI导致传统评估失效的问题,提出对话式考试——一种可扩展的口试形式,通过让学生现场编码并解释推理过程来恢复评估有效性,并在58名学生中验证其可行性。

Comments 12 pages

Journal ref Computer, vol. 59, no. 6, pp. 132-139, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 50%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 其他推理 :reasoning(abstract)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12795 2026-06-02 cs.SE 50%

When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective

当大型语言模型遇到无人机项目:来自开发者视角的实证研究

Yihua Chen, Xingle Que, Jiashuo Zhang, Jiachi Chen, Ting Cui, Guangshun Li, Ting Chen

专题命中 其他推理 :reasoning(abstract)

AI总结 通过分析997篇论文和1509个GitHub项目,并调查52位从业者,本研究分类了无人机项目中大型语言模型(LLM)的九种常见任务和四种工作流,揭示了研究与工业实践之间的差异,并指出了整合LLM的五大挑战因素。

详情

展开后加载摘要…

URL PDF HTML 收藏