arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2603.26797 2026-03-31 cs.LG 57%

MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement

MemGuard-Alpha:通过成员推断和跨模型分歧检测和过滤受记忆污染的信号在基于LLM的金融预测中

Anisha Roy, Dip Roy

机构 * Jaypee Institute of Information Technology(贾伊皮信息技术学院) Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 MemGuard-Alpha通过成员推断和跨模型分歧方法,检测并过滤LLM生成的受记忆污染的信号,提升金融预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI 57%

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13622 2026-03-30 cs.CV cs.AI 57%

CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models

CARPE:通过集成实现上下文感知的图像表示优先级

Donghee Lee, Rui Cai, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24856 2026-03-27 cs.AI cs.CY cs.ET cs.MA 57%

SentinelAI: A Multi-Agent Framework for Structuring and Linking NG9-1-1 Emergency Incident Data

SentinelAI:一种多智能体框架,用于结构化和链接NG9-1-1应急事件数据

Kliment Ho, Ilya Zaslavsky

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SentinelAI框架,通过多智能体系统实现应急事件数据的标准化和跨源推理,解决NG9-1-1数据标准下的数据整合难题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05127 2026-03-27 cs.AI 57%

The Prompt Canvas: A Literature-Based Practitioner Guide for Creating Effective Prompts in Large Language Models

提示画布:基于文献的从业者指南,用于在大型语言模型中创建有效的提示

Michael Hewing, Vincent Leinhos

机构 * FH Münster – University of Applied Sciences(穆斯特应用科学大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Prompt Canvas,通过文献综述整合提示工程方法,为从业者提供结构化指南,促进大语言模型的应用与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10402 2026-03-26 cs.AI 57%

Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering

迈向超长视界代理科学:认知积累用于机器学习工程

Xinyu Zhu, Yuzhu Cai, Zexi Liu, Bingyang Zheng, Cheng Wang, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Weinan E, Siheng Chen, Yanfeng Wang

机构 * School of Artificial Intelligence(人工智能学院) DP Technology(DP技术) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ML-Master 2.0,通过认知积累机制解决超长视界自主性问题,实现机器学习工程的高效探索。

Comments 25 pages. 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23914 2026-03-26 cs.CV cs.LG 57%

Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

面向大视觉-语言模型的注意力感知推理优化

Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23857 2026-03-26 cs.AI cs.CY cs.SI nlin.CD physics.soc-ph 57%

When AI output tips to bad but nobody notices: Legal implications of AI's mistakes

当AI输出变差但没人注意到:AI错误的法律影响

Dylan J. Restrepo, Nicholas J. Restrepo, Frank Y. Huo, Neil F. Johnson

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) d-AI-ta Consulting(d-AI-ta咨询公司) Dynamic Online Networks Laboratory(动态在线网络实验室) George Washington University(乔治华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在法律领域中的错误风险,指出AI可能伪造法律案例和判例,导致专业制裁和声誉损害,并提出通过验证协议来应对技术责任问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23554 2026-03-26 cs.IR cs.AI 57%

Mixture of Demonstrations for Textual Graph Understanding and Question Answering

演示混合用于文本图理解与问答

Yukun Wu, Lihui Liu

机构 * Independent Researcher, Wayne State University(韦恩州立大学独立研究者) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MixDemo框架,通过MoE机制选择信息丰富的演示,结合查询特定图编码器减少噪声,提升文本图问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23443 2026-03-25 cs.SE cs.AI 57%

Evaluating LLM-Based Test Generation Under Software Evolution

评估基于大语言模型的测试生成在软件演化中的表现

Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23091 2026-03-25 cs.CL 57%

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

当语言模型失去理智:大脑错位的后果

Gabriele Merlin, Mariya Toneva

机构 * MPI-SWS(马克斯·普朗克研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了大脑对齐对语言能力的影响,通过创建大脑错位模型发现其显著损害下游性能,强调了大脑对齐在实现稳健语言能力中的关键作用。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22837 2026-03-25 cs.CL 57%

Analysing LLM Persona Generation and Fairness Interpretation in Polarised Geopolitical Contexts

分析极化地缘政治背景下大语言模型的人格生成与公平性解释

Maida Aizaz, Quang Minh Nguyen

机构 * Graduate School of Data Science(数据科学研究生院) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了五种流行LLM在640种实验条件下生成巴勒斯坦和以色列身份人格的分布特征,揭示了模型在不同情境下对地缘政治身份的公平性解释差异。

Comments EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22791 2026-03-25 cs.AI 57%

ABSTRAL: Automatic Design of Multi-Agent Systems Through Iterative Refinement and Topology Optimization

ABSTRAL:通过迭代精进与拓扑优化自动设计多智能体系统

Weijia Song, Jiashu Yue, Zhe Pang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ABSTRAL通过对比追踪分析将多智能体系统架构视为演化的自然语言文档,发现多智能体协调成本测量、设计知识迁移与专有角色发现三大核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI 57%

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21701 2026-03-24 cs.CV cs.AI 57%

Rethinking Token Reduction for Large Vision-Language Models

重新思考大型视觉-语言模型中的标记缩减

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) School of Software Technology, Zhejiang University(浙江大学软件学院) National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MetaCompress,一种基于学习的无提示方法,解决多轮视觉问答中标记缩减的挑战,通过统一压缩映射提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15276 2026-03-24 cs.DB cs.CL 57%

AmbiSQL: Interactive Ambiguity Detection and Resolution for Text-to-SQL

AmbiSQL: 用于文本到SQL的交互式歧义检测与解决

Zhongjun Ding, Yin Lin, Tianjing Zeng, Rong Zhu, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 AmbiSQL通过交互式多选问题帮助用户澄清意图,解决文本到SQL中的歧义问题,提升SQL生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21155 2026-03-24 cs.AI 57%

Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs

大语言模型能否欺骗图学习?探索文本属性图上的通用对抗攻击

Zihui Chen, Yuling Wang, Pengfei Jiao, Kai Wu, Xiao Wang, Xiang Ao, Dalin Zhang

机构 * School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学信息学院) Hangzhou Dianzi University(杭州电子科技大学) Beihang University(北京航空航天大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BadGraph框架,通过联合扰动节点拓扑和文本语义,实现对文本属性图模型的通用对抗攻击,实验显示攻击效果显著,性能下降达76.3%。

Comments Accepted by TheWebConf (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21036 2026-03-24 cs.CL 57%

Left Behind: Cross-Lingual Transfer as a Bridge for Low-Resource Languages in Large Language Models

落后者:跨语言迁移作为低资源语言在大语言模型中的桥梁

Abdul-Salem Beibitkhan

机构 * North American University(北美大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了大语言模型在低资源语言上的表现,发现英语与低资源语言之间存在13.8-16.7个百分点的性能差距,跨语言迁移对双语架构有帮助,但对英语主导模型无益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20732 2026-03-24 cs.CL 57%

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

MzansiText 和 MzansiLM:一种面向南非语言的开放语料库和解码器-only 语言模型

Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍MzansiText和MzansiLM,针对南非11种官方语言中的9种低资源语言,通过任务特定微调在自然语言理解与生成任务中取得显著成果,但小规模下少量推理仍具挑战性。

Comments 15 pages, 11 tables, appendix included. Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20650 2026-03-24 cs.AI cs.CY 57%

From 50% to Mastery in 3 Days: A Low-Resource SOP for Localizing Graduate-Level AI Tutors via Shadow-RAG

从50%到精通:一种低资源SOP,通过影子RAG本地化研究生级AI导师

Zonglin Yang, J. -H. Xie, Lining Zhang, Jiyou Jia, Zhi-X. Chen

机构 * School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院) Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司) Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院) AI for Science Institute, Beijing, 100080, China(AI for Science研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种低成本SOP,利用影子RAG架构和数据清洗策略,在3人天内本地化研究生级AI导师,使32B模型性能从74%提升至90%。

Comments 9 pages, 3 figures, practitioner report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01162 2026-03-24 cs.LG stat.ML 57%

Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic

解开群体相对策略优化:其策略梯度是U统计量

Hongyi Zhou, Kai Ye, Erhan Xu, Jin Zhu, Ying Yang, Shijin Gong, Chengchun Shi

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文通过经典U统计量框架解析GRPO,证明其策略梯度本质为U统计量,推导其MSE、有限样本误差界及渐近分布,揭示GRPO渐近等价于拥有价值函数的最优策略梯度算法,并建立通用缩放规律指导最优分组大小选择。

Comments 5 pages, 53 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20162 2026-03-23 cs.CL 57%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 57%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18196 2026-03-23 cs.CR cs.AI 57%

Retrieval-Augmented LLMs for Security Incident Analysis

增强检索的大型语言模型用于安全事件分析

Xavier Cadet, Aditya Vikram Singh, Harsh Mamania, Edward Koh, Alex Fitts, Dirk Van Bruggen, Simona Boboila, Peter Chin, Alina Oprea

机构 * Dartmouth College(达特茅斯学院) Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于RAG的系统,通过针对性查询过滤和LLM语义推理分析安全事件,展示LLM在恶意软件和Active Directory攻击中的高召回率和精度,证明RAG架构在安全分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 57%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 57%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18631 2026-03-20 cs.AI 57%

D-Mem: A Dual-Process Memory System for LLM Agents

D-Mem:一种用于LLM代理的双过程记忆系统

Zhixing You, Jiachen Yuan, Jason Cai

机构 * Einstein Institute of Mathematics(爱因斯坦数学研究所) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) AWS AI(AWS人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出D-Mem双过程记忆系统,通过轻量向量检索与全面深入模块结合,提升长期推理准确性,实验表明其在LoCoMo基准上F1得分达53.5,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16424 2026-03-20 cs.AI cs.MA 57%

Verifiable Semantics for Agent-to-Agent Communication

可验证的语义用于智能体间通信

Philipp Schoenegger, Matt Carlson, Chris Schneider, Chris Daly

机构 * Microsoft AI(微软人工智能) Wabash College(瓦巴什学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于刺激-意义模型的认证协议,通过验证共享事件和术语的语义一致性,减少智能体间分歧。核心 guarded 推理降低分歧72-96%,语言模型验证中减少51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08388 2026-03-20 cs.CL 57%

If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models

如果可能,那么可接受?理解大型语言模型中的条件可接受性判断

Jasmin Orth, Philipp Mondorf, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML),慕尼黑)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在评估条件语句'若A则B'的可接受性时如何结合条件概率与语义相关性,发现模型对这两因素的敏感度因架构和提示策略而异,且比人类更不一致。

Comments EACL 2026 Main, 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏