arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2506.19733 2026-03-03 cs.CL 57%

Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?

打破壁垒:强化学习后训练的增益是否能转移到未见领域?

Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了强化学习后训练在不同领域中的泛化能力,发现其增益在不同推理模式的领域中不一致。

Comments ICLR 2026; 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 57%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00565 2026-03-03 cs.CV cs.AI cs.CR 57%

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型

Yilian Liu, Xiaojun Jia, Guoshun Nan, Jiuyang Lyu, Zhican Chen, Tao Guan, Shuyuan Luo, Zhongyi Zhai, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。

Journal ref The Fourteenth International Conference on Learning Representations(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00364 2026-03-03 cs.CL 57%

Distribution-Aware Companding Quantization of Large Language Models

面向分布的扩增量化:大型语言模型

Athul Radhakrishnan, Siddhant Mohan, Mahima Sachdeva

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出一种多标记预测方法,通过提升样本效率和推理速度,显著提高大型语言模型在编码等生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00066 2026-03-03 cs.CY cs.AI 57%

Contesting Artificial Moral Agents

挑战人工道德代理

Aisha Aijaz

机构 * IIIT-Delhi(德里印度理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种5E框架,用于挑战人工道德代理的道德性,涵盖伦理、认识论、可解释性、经验和评估五个方面,并提供时间线以指导价值对齐的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 57%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23792 2026-03-02 cs.CL 57%

Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding

分而治之:通过自适应并行解码加速扩散式大语言模型

Xiangzhong Luo, Yilin An, Zhicheng Yu, Weichen Liu, Xu Yang

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 DiCo通过分而治之的自适应并行解码方法,提升扩散式大语言模型的推理速度并保持生成质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19364 2026-03-02 cs.AI cs.MA 57%

Integrating LLM in Agent-Based Social Simulation: Opportunities and Challenges

将大语言模型整合到基于代理的社会模拟中:机遇与挑战

Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard, Benoit Gaudou, Nghi Quang Huynh, Alexis Drogoul

机构 * UR MIAT, University of Toulouse, INRAE, Castanet-Tolosan, France(法国图卢兹大学UR MIAT,INRAE,Castanet-Tolosan分校) UMI 209 UMMISCO, IRD/Sorbonne University, Bondy, France(法国Bondy IRD/索邦大学UMI 209 UMMISCO) LMI ACROSS, Thuyloi University, Hanoi, Vietnam(越南胡志明大学LMI ACROSS) UMR 5505 IRIT, University of Toulouse Capitole, Toulouse, France(法国图卢兹大学Capitole UMR 5505 IRIT) CICT, Can Tho University, Can Tho, Vietnam(越南金瓯大学CICT)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在社会模拟中的应用,分析其潜力与局限,并提出混合宪法架构作为整合LLM与传统代理模型的可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23400 2026-03-02 cs.LG 57%

U-CAN: Utility-Aware Contrastive Attenuation for Efficient Unlearning in Generative Recommendation

U-CAN:面向生成推荐中高效遗忘的效用感知对比衰减

Zezheng Wu, Rui Wang, Xinghe Cheng, Yang Shao, Qing Yang, Jiapu Wang, Jingwei Zhang

机构 * Guilin University of Electronic Technology(桂林电子科技大学) University of Southampton(南安普顿大学) Jinan University(暨南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 U-CAN通过低秩适配器实现生成推荐中的高效隐私遗忘,利用效用感知对比衰减机制提升效用保留与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23266 2026-02-27 cs.CL 57%

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

面向 discourse 的双轨流式响应用于低延迟语音对话系统

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) School of Data Science, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 DDTSR 提出了一种低延迟语音对话系统框架,通过双轨流式响应机制实现听中思考和说中思考,显著降低响应延迟并保持 discourse 质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22278 2026-02-27 cs.IR cs.LG 57%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20659 2026-02-26 cs.AI 57%

Recursive Belief Vision Language Action Models

递归信念视觉语言动作模型

Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel

机构 * Department of Engineering Design, Indian Institute of Technology, Madras, Chennai, India(工程设计系,印度理工学院,马德拉斯,钦奈,印度)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 RB-VLA通过信念与意图联合条件化扩散策略,实现长周期任务的高效执行,显著提升成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13477 2026-02-26 cs.AI 57%

OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage

OMNI-LEAK:协调多智能体网络引发的数据泄露

Akshat Naik, Jay Culligan, Yarin Gal, Philip Torr, Rahaf Aljundi, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 OMNI-LEAK攻击通过多智能体协调设置中的单个提示注入泄露敏感数据,揭示了多代理系统在数据安全方面的关键漏洞。

Comments Preprint; corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21715 2026-02-26 eess.SY cs.AI cs.SY 57%

Two-Stage Active Distribution Network Voltage Control via LLM-RL Collaboration: A Hybrid Knowledge-Data-Driven Approach

通过LLM-RL协作的两阶段主动配电网电压控制:一种混合知识-数据驱动方法

Xu Yang, Chenhui Lin, Xiang Ma, Dong Liu, Ran Zheng, Haotian Liu, Wenchuan Wu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种混合知识-数据驱动方法,通过LLM与RL协作实现主动配电网两阶段电压控制,提升电压调节效率与电网质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21593 2026-02-26 cs.LG cs.CR cs.CV 57%

Breaking Semantic-Aware Watermarks via LLM-Guided Coherence-Preserving Semantic Injection

破坏语义感知水印:通过LLM引导的保持连贯性语义注入

Zheng Gao, Xiaoyu Li, Zhicheng Bao, Xiaoyan Feng, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CSI攻击,利用LLM引导的语义操纵破坏语义水印的绑定,揭示当前语义水印设计在面对LLM驱动的语义扰动时的安全漏洞。

Comments Accepted by The Web Conference 2026 (Short Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20966 2026-02-25 cs.CL 57%

Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models

黑鸟语言矩阵:一种研究语言模型语言能力的框架

Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

机构 * Idiap Research Institute(Idiap研究机构) University of Geneva(日内瓦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 黑鸟语言矩阵通过结构化数据集研究语言模型的语言能力与系统性模式识别

Comments Under review, 46 pages, 5 tables, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14044 2026-02-25 cs.CL 57%

Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness

上下文影响基于LLM的检索增强事实核查效果

Pietro Bernardelle, Stefano Civelli, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨了上下文对LLM检索增强事实核查效果的影响,发现上下文长度和证据位置显著影响验证准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05182 2026-02-25 cs.CL 57%

The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems

单一-多进化循环用于自我改进的模型协作系统

Shangbin Feng, Kishan Panaganti, Yulia Tsvetkov, Wenhao Yu

机构 * University of Washington(华盛顿大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出单一-多进化循环,通过模型协作与蒸馏实现自我改进,提升模型性能与效率。

Comments Code at https://github.com/BunsenFeng/moco_distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12007 2026-02-25 cs.IR cs.AI 57%

Diffusion Generative Recommendation with Continuous Tokens

基于连续令牌的扩散生成推荐

Haohao Qu, Shanru Lin, Yujuan Ding, Yiqi Wang, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) National University of Defense Technology(国防科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ContRec通过整合连续令牌和扩散模型,提升基于LLM的推荐系统性能。

Comments Accepted by The ACM Web Conference (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17842 2026-02-24 cs.CL 57%

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Shop-R1: 通过强化学习奖励大语言模型模拟在线购物中的人类行为

Yimeng Zhang, Tian Wang, Jiri Gesi, Ziyi Wang, Yuxuan Lu, Jiacheng Lin, Sinong Zhan, Vianne Gao, Ruochen Jiao, Junze Liu, Kun Qian, Yuxin Tang, Ran Xue, Houyu Zhang, Qingjun Cui, Yufan Guo, Dakuo Wang

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Shop-R1通过强化学习框架提升大语言模型在在线购物场景中模拟人类行为的推理能力,实现65%以上的性能提升。

Comments Accepted by ICLR 2026. The project page is available at https://damon-demon.github.io/shop-r1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19359 2026-02-24 cs.RO cs.LG 57%

Vid2Sid: Videos Can Help Close the Sim2Real Gap

Vid2Sid: 视频可以帮助缩小仿真到现实的差距

Kevin Qiu, Yu Zhang, Marek Cygan, Josie Hughes

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Vid2Sid通过视频驱动的系统识别方法,结合基础模型感知与VLM循环优化器,实现仿真到现实的物理参数校准,提供可解释的推理并提升校准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 57%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI 57%

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11842 2026-02-24 cs.LG stat.ML 57%

Test-Time Training Provably Improves Transformers as In-context Learners

测试时训练可证明地提高变换器作为上下文学习者

Halil Alperen Gozeten, M. Emrullah Ildiz, Xuechen Zhang, Mahdi Soltanolkotabi, Marco Mondelli, Samet Oymak

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 测试时训练通过调整模型权重提升变换器在上下文学习中的性能,减少样本需求并提高推理效率。

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17452 2026-02-20 cs.CR cs.AI 57%

Jolt Atlas: Verifiable Inference via Lookup Arguments in Zero Knowledge

Jolt Atlas: 通过查找论证实现可验证推断在零知识中

Wyatt Benno, Alberto Centelles, Antoine Douchet, Khalil Gibran

机构 * ICME Labs(ICME实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Jolt Atlas是一种零知识机器学习框架,通过查找论证实现可验证推断,支持在内存受限环境中进行流式证明,并适用于隐私和对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 57%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16844 2026-02-20 cs.HC cs.AI 57%

Overseeing Agents Without Constant Oversight: Challenges and Opportunities

无需持续监督的代理:挑战与机遇

Madeleine Grunde-McLaughlin, Hussein Mozannar, Maya Murad, Jingya Chen, Saleema Amershi, Adam Fourney

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了无需持续监督的代理系统在验证中的挑战与机遇,通过实验发现简化轨迹设计可提高错误发现效率,但未显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03710 2026-02-19 cs.LG 57%

Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards

缩减方差:用于具有可验证奖励的强化学习的收缩基线

Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于收缩估计的基线方法,用于改进具有可验证奖励的强化学习中策略梯度估计器的方差,通过结合每个提示和跨提示的均值来提高估计准确性。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16188 2026-02-19 cs.LG 57%

Deep TPC: Temporal-Prior Conditioning for Time Series Forecasting

深度时间序列预测中的时间先验条件:时间序列预测中的时间先验条件

Filippos Bellos, NaveenJohn Premkumar, Yannis Avrithis, Nam H. Nguyen, Jason J. Corso

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TPC方法,通过时间先验条件提升时间序列预测性能,实现低参数预算下的长周期预测优化。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏