arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2407.17454 2026-03-20 cs.AI 57%

Automated Explanation Selection for Scientific Discovery

科学发现中的自动化解释选择

Ashlin Iser

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合机器学习和自动推理的科学发现循环,通过社会学和认知科学的洞察,构建解释选择的分类体系,扩展并完善现有解释方法。

Comments Composite AI Workshop at ECAI 2024 (accepted for publication)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 57%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 57%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20651 2026-03-20 cs.AI 57%

Memory Bear AI A Breakthrough from Memory to Cognition Toward Artificial General Intelligence

记忆熊AI:从记忆到认知迈向通用人工智能的突破

Deliang Wen, Ke Sun

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Memory Bear系统,通过整合多模态感知、动态记忆维护和适应性认知服务,提升LLM的记忆机制,实现跨领域知识准确性和检索效率的提升,减少幻觉并增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL 57%

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17311 2026-03-19 cs.CL 57%

Ruyi2.5 Technical Report

Ruyi2.5 技术报告

Huan Song, Shuyu Tian, Qingfei Zhao, Wenhao Hong, Jiang Liu, Ting Long, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Ruyi2.5基于AI Flow框架构建多模态家族模型,通过共享主干架构实现多尺度模型协同训练,提升部署层级语义一致性,同时提出隐私保护摄像头系统及BPPO算法加速强化学习微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25693 2026-03-19 cs.AI 57%

ScheduleMe: Multi-Agent Calendar Assistant

ScheduleMe: 多智能体日历助手

Oshadha Wijerathne, Amandi Nimasha, Dushan Fernando, Nisansa de Silva, Srinath Perera

机构 * Department of Computer Science & Engineering, University of Moratuwa(moratuwa大学计算机科学与工程系) WSO2 LLC(WSO2公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ScheduleMe,一种多智能体日历助手,通过自然语言帮助用户管理Google日历事件。系统采用图结构协调机制,通过中央监督代理和专用任务代理实现模块化、冲突解决和上下文感知交互。

Comments Published at PACLIC 2025 https://aclanthology.org/2025.paclic-1.27/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21524 2026-03-18 cs.AI cs.IT math.IT 57%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15661 2026-03-18 cs.AI 57%

DynaTrust: Defending Multi-Agent Systems Against Sleeper Agents via Dynamic Trust Graphs

DynaTrust: 通过动态信任图防御多智能体系统中的睡眠代理

Yu Li, Qiang Hu, Yao Zhang, Lili Quan, Jiongchi Yu, Junjie Wang

机构 * Tianjin University(天津大学) Singapore Management University(新加坡管理学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DynaTrust,通过动态信任图防御多智能体系统中的睡眠代理,动态更新信任并重构图以隔离受损代理,提升防御效果和系统可用性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14805 2026-03-18 cs.PL cs.AI 57%

Sharing State Between Prompts and Programs

在提示和程序之间共享状态

Ellie Y. Cheng, Logan Weber, Tian Jin, Michael Carbin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出共享程序状态抽象,使提示可直接访问程序变量并实现控制流,通过Nightjar系统验证了其在任务准确性和代码效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09823 2026-03-17 cs.SD cs.CL eess.AS 57%

Covo-Audio Technical Report

Covo-Audio技术报告

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14553 2026-03-17 hep-ph cs.AI cs.MA hep-ex 57%

An End-to-end Architecture for Collider Physics and Beyond

通向对撞机物理与更广泛领域端到端架构的架构

Shi Qiu, Zeyu Cai, Jiashen Wei, Zeyu Li, Yixuan Yin, Qing-Hong Cao, Chang Liu, Ming-xing Luo, Xing-Bo Yuan, Hua Xing Zhu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于语言的智能体系统,实现端到端对撞机现象学任务,通过解耦、领域无关的架构实现自主高能物理现象学研究,展示了其在粒子物理、宇宙学等领域的应用潜力。

Comments 15 pages, 3 figure, project website: AGI/ColliderAgent" target="_blank" rel="noopener">https://github.com/HET-AGI/ColliderAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14057 2026-03-17 cs.AI 57%

Demand-Driven Context: A Methodology for Building Enterprise Knowledge Bases Through Agent Failure

需求驱动的上下文:通过智能体失败构建企业知识库的方法论

Raj Navakoti, Saideep Navakoti

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出需求驱动上下文方法,通过智能体失败信号来获取企业领域知识,解决传统知识工程方法的局限性,展示在零售订单履行中的应用案例。

Comments 18 pages, 5 figures, 1 algorithm. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 57%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13264 2026-03-17 cs.LG cs.IR 57%

Federated Personal Knowledge Graph Completion with Lightweight Large Language Models for Personalized Recommendations

联邦轻量级大语言模型用于个性化推荐的知识图谱补全

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出FedTREK-LM框架,结合轻量级大语言模型、演化个人知识图谱和联邦学习,实现可扩展的去中心化个性化推荐,实验显示其在电影和食谱推荐中F1分数提升超4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13250 2026-03-17 cs.CY cs.AI 57%

The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries

缺失的红色线:商业压力如何侵蚀AI安全边界

Nora Petrova, John Burden

机构 * Prolific

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现商业提示会削弱AI安全边界,导致模型在医疗风险中撒谎、忽视安全,优先利润而非用户福祉,且无明确红线机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12826 2026-03-16 cs.CL 57%

Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design

重新思考用于RLVR的多项选择题:通过干扰项设计解锁潜力

Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了干扰项设计对RLVR的影响,发现选项数量不匹配和强干扰项能有效减少随机猜测,提出IDC框架提升干扰项质量,实验表明在多个基准上显著提升了RLVR训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12813 2026-03-16 cs.AI 57%

Context is all you need: Towards autonomous model-based process design using agentic AI in flowsheet simulations

上下文即一切:利用流表模拟中的代理AI实现自主的基于模型的过程设计

Pascal Schäfer, Lukas J. Krinke, Martin Wlotzka, Norbert Asprion

机构 * BASF SE(巴斯夫股份有限公司) RWTH Aachen University(亚琛工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种代理AI框架,利用先进LLM在工业流表模拟环境中辅助过程设计,通过分解任务实现工程知识与代码生成的协同,展示了在反应分离、压力 swing 蒸馏和异构azeotropic 蒸馏中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17288 2026-03-16 cs.CL eess.AS 57%

Triple X: A LLM-Based Multilingual Speech Recognition System for the INTERSPEECH2025 MLC-SLM Challenge

三X:一种基于LLM的多语言语音识别系统,用于INTERSPEECH2025 MLC-SLM挑战

Miaomiao Gao, Xiaoxiao Xiang, Yiwen Guo

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Triple X系统,通过创新的编码器-适配器-LLM架构优化多语言对话场景的语音识别准确率,采用多阶段训练策略提升多语言识别性能,实验结果显示在开发和测试集上取得竞争力的词错误率表现。

Comments Accepted By Interspeech 2025 MLC-SLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15509 2026-03-16 cs.HC cs.CL 57%

Representing data in words: A context engineering approach

用词语表示数据:一种上下文工程方法

Amandine M. Caut, Amy Rouillard, Beimnet Zenebe, Matthias Green, Ágúst Pálmason Morthens, David J. T. Sumpter

机构 * Information Technology Department Uppsala University(乌普萨拉大学信息技术系) Physics Department Stellenbosch University(斯坦福大学物理系) Computer Science Department Addis Ababa University(亚的斯亚贝巴大学计算机科学系) Insa Toulouse(图卢兹大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出wordalisations方法,通过上下文工程生成自然的描述性文本,用于足球球员评估、性格测试和国际调查数据,通过LLM和人类评估验证其准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10504 2026-03-12 cs.CR cs.AI cs.CV 57%

Naïve Exposure of Generative AI Capabilities Undermines Deepfake Detection

生成AI能力的盲目暴露削弱了深度伪造检测

Sunpill Kim, Chanwoo Hwang, Minsu Kim, Jae Hong Seo

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10313 2026-03-12 cs.CL 57%

Large language models can disambiguate opioid slang on social media

大语言模型可以区分社交媒体上的阿片类药物俚语

Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Altman

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 大语言模型能有效区分社交媒体上的阿片类药物俚语,提升低发病率主题的数据分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10143 2026-03-12 cs.CL 57%

Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation

推理与验证:一种忠实检索增强生成的框架

Eeham Khan, Luis Rodriguez, Marc Queudot

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种领域特定的RAG框架,通过显式推理和验证机制提升检索增强生成的准确性与透明性,在生物医学问答任务中取得显著性能提升。

Comments Accepted to Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01246 2026-03-12 cs.CR cs.AI 57%

Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders

防御性拒绝偏差:安全对齐如何失败于网络防御者

David Campbell, Neil Kale, Udari Madhushani Sehwag, Bert Herring, Nick Price, Dan Borges, Alex Levinson, Christina Q Knight

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09786 2026-03-11 cs.AI 57%

Quantifying the Necessity of Chain of Thought through Opaque Serial Depth

通过模糊序列深度量化链式思维的必要性

Jonah Brown-Cohen, David Lindner, Rohin Shah

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过模糊序列深度量化链式思维的必要性,分析了大型语言模型和混合专家模型的推理深度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09486 2026-03-11 cs.AI 57%

Vibe-Creation: The Epistemology of Human-AI Emergent Cognition

Vibe-Creation:人类与人工智能涌现认知的 epistemology

Ilya Levin

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出‘vibe-creation’概念,探讨人类与生成式人工智能交互产生的认知-认识论形成‘第三实体’,并分析其对教育理论和知识能力的深远影响。

Comments 11 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09232 2026-03-11 cs.SD cs.CL eess.AS 57%

How Contrastive Decoding Enhances Large Audio Language Models?

对比解码如何增强大型音频语言模型?

Tzu-Quan Lin, Wei-Ping Huang, Yi-Cheng Lin, Hung-yi Lee

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过对比解码策略评估,发现音频感知解码和音频对比解码在不同模型中效果各异,揭示了CD在纠正特定错误类型上的有效性及局限性。

Comments Submitted to INTERSPEECH 2026. Code and additional analysis results are provided in our repository: https://github.com/nervjack2/LALM-Contrastive-Decoding-Error-Profiles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09206 2026-03-11 cs.CV cs.LG 57%

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏