arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-23 至 2026-02-23 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2602.18374 2026-02-23 cs.RO cs.AI 57%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17037 2026-02-23 cs.SE cs.AI cs.HC cs.PL 57%

Wink: Recovering from Misbehaviors in Coding Agents

Wink: 代码代理中行为失误的恢复

Rahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10855 2026-02-23 cs.LG 57%

ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries

ExPairT-LLM:通过成对查询实现LLM代码选择的精确学习

Tom Yuviler, Dana Drachsler-Cohen

机构 * Tom Yuviler(独立研究者) Dana Drachsler-Cohen(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 ExPairT-LLM通过成对查询提升LLM代码选择的精确性,实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 57%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16206 2026-02-23 cs.HC 50%

The Agony of Opacity: Foundations for Reflective Interpretability in AI-Mediated Mental Health Support

透明的痛苦:面向人工智能辅助心理健康支持的反思可解释性基础

Sachin R. Pendse, Darren Gergle, Rachel Kornfield, Kaylee Kruzan, David Mohr, Jessica Schleider, Jina Suh, Annie Wescott, Jonah Meyerhoff

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种面向人工智能辅助心理健康支持的反思可解释性方法,旨在提升用户对模型输出的理解和自主性,以应对严重心理困扰的特殊需求。

Comments Accepted to IASEAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18010 2026-02-23 cs.SD 50%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 8 篇

2601.19318 2026-02-23 cs.RO cs.CV 82%

Perception-to-Pursuit: Track-Centric Temporal Reasoning for Open-World Drone Detection and Autonomous Chasing

感知到追捕:面向开放世界的无人机检测与自主追捕的以轨迹为中心的时序推理

Venkatakrishna Reddy Oruganti

机构 * Sithara Inc.(Sithara公司)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 P2P通过轨迹为中心的时序推理框架,提升了无人机轨迹预测精度和追捕可行性,实现了准确的预测与可操作的追捕规划。

Comments 7 pages, 2 figures, 3 tables, 15 references. Intended for submission to ICCV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17592 2026-02-23 astro-ph.IM cs.LG 79%

AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model

AstroMLab 4: 在天文学问答中通过700亿参数领域专用模型实现基准顶级性能

Tijmen de Haan, Yuan-Sen Ting, Tirthankar Ghosal, Tuan Dung Nguyen, Alberto Accomazzi, Emily Herron, Vanessa Lama, Rui Pan, Azton Wells, Nesar Ramachandra

机构 * Institute of Particle Nuclear Studies (IPNS), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan International Center for Quantum-field Measurement Systems for Studies of the Universe Particles (QUP-WPI), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan Department of Astronomy, The Ohio State University, Columbus, OH, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH, USA National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, TN, USA Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA Center for Astrophysics, Harvard \& Smithsonian, Cambridge, MA, USA Siebel School of Computing Data Science, University of Illinois at Urbana-Champaign, Urbana-Champaign, IL, USA Computational Science Division, Argonne National Laboratory, Lemont, IL, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 AstroSage-Llama-3.1-70B通过700亿参数领域专用模型在天文学问答中实现顶级性能,优于GPT-5.2等通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18137 2026-02-23 cs.CL cs.AI cs.LG 67%

Agentic Adversarial QA for Improving Domain-Specific LLMs

代理对抗问答:提升领域特定大语言模型

Vincent Grari, Ciprian Tomoiaga, Sylvain Lamprier, Tatsunori Hashimoto, Marcin Detyniecki

机构 * Stanford University(斯坦福大学) Polish Academy of Science, IBS PAN, Warsaw, Poland(波兰科学院、IBS PAN、华沙、波兰)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种对抗性问题生成框架,通过生成语义具有挑战性的问题来提升领域特定大语言模型的适应能力。

Comments 9 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 67%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 62%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15854 2026-02-23 cs.CL cs.AI 62%

Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization

通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行

Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You

机构 * School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国) College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GOPO框架,通过解耦策略规划与响应生成,提升任务导向对话系统的长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17311 2026-02-23 cs.CL cs.AI 62%

FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluation

FLUKE:一种基于语言驱动且任务无关的鲁棒性评估框架

Yulia Otmakhova, Hung Thinh Truong, Rahmad Mahendra, Zenan Zhai, Rongxin Zhu, Daniel Beck, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) Oracle(Oracle公司) Universitas Indonesia(印度尼西亚大学) RMIT University(皇家墨尔本理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FLUKE通过系统性语言变化评估模型鲁棒性,揭示任务依赖性、模型脆弱性和语言特征使用与鲁棒性无关的结论。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 57%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 4 篇

2602.18297 2026-02-23 cs.LG cs.AI cs.CL cs.IT math.IT 87%

Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory

通过信息论分析和改进链式思维可监控性

Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos

机构 * University of Cambridge(剑桥大学) Qualcomm AI Research(高通人工智能研究)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息论分析,提出两种方法改进链式思维监控器的可监控性,以提高监控准确性并防止奖励黑客问题。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17738 2026-02-23 cs.MA cs.IT math.IT 78%

Reasoning-Native Agentic Communication for 6G

面向6G的推理原生代理通信

Hyowoon Seo, Joonho Seon, Jin Young Kim, Mehdi Bennis, Wan Choi, Dong In Kim

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出推理原生代理通信,旨在通过协调平面解决6G网络中自主机器间的信念分歧问题,提升异构系统间的协同一致性。

Comments 8 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17937 2026-02-23 cs.CL cs.PL 77%

Analyzing LLM Instruction Optimization for Tabular Fact Verification

分析用于表格事实验证的LLM指令优化

Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway

机构 * University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文研究了指令优化在表格事实验证中的应用,发现MiPROv2在CoT中表现最佳,SIMBA在ReAct中效果显著,且CoT在小模型中仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17799 2026-02-23 cs.CV 50%

Enabling Training-Free Text-Based Remote Sensing Segmentation

无需训练的基于文本的遥感分割

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出无需额外训练的遥感分割方法,结合对比和生成型VLMs与SAM,实现零样本开放词汇语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏