arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2605.16575 2026-05-19 cs.AI 57%

Counterparty Modeling is Not Strategy: The Limits of LLM Negotiators

对手建模不是策略:大语言模型谈判者的局限

Romain Cosentino, Sarath Shekkizhar, Adam Earle, Silvio Savarese

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在多属性谈判中的表现,发现其能建模对手偏好但无法有效转化为战略谈判,最终协议受初始锚定影响大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16481 2026-05-19 cs.CV cs.AI 57%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16480 2026-05-19 q-bio.BM cs.AI 57%

MoleCode unlocks structural intelligence in large language models

MoleCode 解锁大型语言模型中的结构智能

Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

机构 * Peking University Shenzhen Graduage School

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MoleCode 通过引入图显分子语言,使大型语言模型能直接操作分子结构,提升分子推理、编辑、生成和分析任务的性能,尤其在结构受限场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16079 2026-05-18 cs.CV cs.AI cs.HC 57%

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

VideoSeeker:通过原生代理工具调用激励实例级视频理解

Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) Xi’an Jiaotong University(西安交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。

Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10100 2026-05-18 cs.AI 57%

Robust AI Security and Alignment: A Sisyphean Endeavor?

稳健的AI安全与对齐:一项西西弗斯式的努力?

Apostol Vassilev

机构 * CSD/ITL(计算机科学与技术实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过扩展哥德尔不完全性定理,探讨了AI安全与对齐的理论极限,并提出应对挑战的实践方法,揭示了AI系统认知推理的局限性。

Comments 17 pages, 1 figure. This version will appear in IEEE Security $ Privacy in June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19931 2026-05-18 cs.IR cs.AI 57%

LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Training

LLM-EDT: 基于大语言模型的跨领域序列推荐增强方法与双阶段训练

Ziwei Liu, Qidong Liu, Wanyu Wang, Yejing Wang, Pengyue Jia, Tong Xu, Wei Huang, Chong Chen, Xiangyu Zhao

机构 * City University of Hong Kong Hong Kong China Xi'an Jiaotong University \& City University of Hong Kong Xi'an China University of Science Independent Researcher Beijing China Tsinghua University Beijing China City University of Hong Kong Xi'an Jiaotong University \& City University of Hong Kong Independent Researcher Tsinghua University

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LLM-EDT,通过双阶段训练策略解决跨领域序列推荐中的领域不平衡和过渡问题,引入可转移物品增强器和领域感知配置模块,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15672 2026-05-18 cs.CV cs.AI 57%

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

VLMs 跟踪无需跟踪:诊断视觉路径跟随中的失败

Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

机构 * Yonsei University(延世大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究VLMs在视觉路径跟随任务中的表现,发现其在面对局部相似干扰时易切换路径,揭示局部竞争导致的失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15609 2026-05-18 cs.CL 57%

PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding

PSD: 推动扩散大语言模型的帕累托前沿:通过并行推测解码

Shengyin Sun, Yiming Li, Renxi Liu, Xinqi Li, Hui-Ling Zhen, Weizhe Lin, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Chen Ma

机构 * Huawei Technologies(华为技术)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PSD框架,通过并行推测解码提升推理效率与生成质量,在推理效率和生成质量之间取得良好平衡,达到每前向传递5.5倍的token处理速度。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14354 2026-05-18 cs.CL 57%

LLM-based Detection of Manipulative Political Narratives

基于大语言模型的操纵性政治叙事检测

Sinclair Schneider, Florian Steuber, Gabi Dreo Rodosek

机构 * University of the Bundeswehr Munich(联邦国防军大学慕尼黑)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种检测和组织操纵性政治叙事的新框架,通过预处理过滤和无监督聚类识别出41个操纵性叙事集群。

Comments This paper has been submitted to the upcoming 18th International Conference on Advances in Social Networks Analysis and Mining (ASONAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09033 2026-05-18 cs.CR cs.AI 57%

ShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel Conflicts

ShadowMerge:一种通过关系通道冲突的图基agent内存新型污染攻击

Yang Luo, Zifeng Kang, Tiantian Ji, Xinran Liu, Yong Liu, Shuyu Li, Lingyun Peng

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE)(可信分布式计算与服务重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Laboratory(中关村实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ShadowMerge攻击,通过关系通道冲突攻击图基agent内存,利用冲突值影响agent行为,改进现有攻击方法,实现93.8%的攻击成功率。

Comments Preprint. Corresponding authors: Zifeng Kang and Tiantian Ji. Code is available at https://anonymous.4open.science/status/ShadowMerge-033C

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02597 2026-05-18 cs.CV cs.AI 57%

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

视觉即理解:解锁因果注意力以实现模态互注意力用于多模态大语言模型

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

机构 * Sony Group Corporation, Tokyo, Japan(索尼集团,日本东京)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出模态互注意力机制,通过解锁因果注意力,提升多模态理解性能,无需额外参数,在12个基准测试中平均提升6.2%。

Comments ICML 2026. Code is available at https://github.com/sony/aki

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI 57%

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14495 2026-05-15 cs.MM cs.AI 57%

Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification

可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证

Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。

Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14483 2026-05-15 cs.AI 57%

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

LEMON:通过反事实强化学习学习可执行多智能体编排

Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 LEMON通过反事实强化学习生成可执行的多智能体编排规范,整合任务特定角色、定制职责、容量级别和依赖结构,提升多智能体系统解决方案质量和执行效率。

Comments Submitted to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14458 2026-05-15 cs.AI 57%

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04236 2026-05-15 cs.LG 57%

Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals

通过顺序证据累积实现LLM集成的自适应共识:自动预算识别和校准的承诺信号

Roberto E. Medina

机构 * Independent Researcher(独立研究员)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DASE方法,通过顺序证据累积实现LLM集成的自适应共识,通过自动预算识别和校准承诺信号提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16659 2026-05-15 cs.AI econ.GN q-fin.EC 57%

LLMs learn scientific taste from institutional traces across the social sciences

大语言模型通过社会科学研究中的机构痕迹学习科学品味

Ziqin Gong, Ning Li, Huaikang Zhou

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 57%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI 57%

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13411 2026-05-14 cs.CR cs.CL 57%

Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

基于外部化攻击-防御共演的模型无关持续LLM安全

Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan, Qiwei Ye, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 57%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26969 2026-05-14 cs.IR cs.AI 57%

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune: 多智能体与自演化技能 hub 用于推荐系统优化

Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

机构 * Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AgenticRecTune框架,通过五个智能体实现端到端配置优化,利用LLM进行最优配置空间探索,结合自演化Skillhub提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09025 2026-05-14 cs.CV cs.AI 57%

Skill-Conditioned Visual Geolocation for Vision-Language Models

基于技能的视觉地理定位用于视觉-语言模型

Chenjie Yang, Yutian Jiang, Yutong Deng, Chenyu Wu

机构 * Southwest Jiaotong University(西南交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12426 2026-05-13 cs.CL 57%

Geometric Factual Recall in Transformers

变换器中的几何事实回忆

Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 57%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12120 2026-05-13 cs.AI 57%

To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

语言模型对谁进行对齐?在高风险竞争需求下测量主导层级

Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz, Andrew M. Bean

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) University of Oxford(牛津大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 57%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09115 2026-05-13 cs.CR cs.AI 57%

AI Native Asset Intelligence

原生AI资产智能

Gal Engelberg, Leon Goldberg, Konstantin Koutsyi, Boris Plotnikov, Tiltan Gilat, Ben Benhemo

机构 * Sola Security(Sola安全)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出原生AI资产智能框架,通过结构化方法整合异构安全数据,实现一致、上下文感知和主动的资产推理。框架结合建模层和评分层,通过敏感性分析和消融研究验证其在资产优先级和安全态势推理中的有效性。

Comments 23 pages, 4 figures, 8 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 57%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏