arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-11 至 2026-02-11 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 19 篇

2602.09442 2026-02-11 cs.CL cs.AI 86%

Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts

评估RAG系统中的社会偏见:当外部上下文有助于而推理有害

Shweta Parihar, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。

Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 83%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10092 2026-02-11 cs.CL 79%

Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing

量子审计:评估大语言模型在量子计算上的推理极限

Mohamed Afane, Kayla Laufer, Wenqi Wei, Ying Mao, Junaid Farooq, Ying Wang, Juntao Chen

机构 * Fordham University(福特汉姆大学) University of Michigan-Dearborn(密歇根大学-迪尔本分校) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09147 2026-02-11 cs.CL 79%

Overview of PAN 2026: Voight-Kampff Generative AI Detection, Text Watermarking, Multi-Author Writing Style Analysis, Generative Plagiarism Detection, and Reasoning Trajectory Detection

PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测

Janek Bevendorff, Maik Fröbe, André Greiner-Petter, Andreas Jakoby, Maximilian Mayerl, Preslav Nakov, Henry Plutz, Martin Potthast, Benno Stein, Minh Ngoc Ta, Yuxia Wang, Eva Zangerle

机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) University of Applied Sciences BFI(应用科学大学BFI) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) University of Kassel(卡塞尔大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08321 2026-02-11 cs.CL 79%

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

改进大型语言模型中的数据与奖励设计以提升科学推理能力

Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10192 2026-02-11 cs.CL cs.DB 77%

Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL

Text2SQL-Flow:一种鲁棒的SQL感知数据增强框架用于文本到SQL

Qifeng Cai, Hao Liang, Chang Xu, Tao Xie, Wentao Zhang, Bin Cui

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Text2SQL-Flow提出了一种SQL感知的数据增强框架,通过生成高质量的文本到SQL数据集,提升大型语言模型在问题解决和检索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 67%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09214 2026-02-11 cs.CV 67%

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

VLM-UQBench:一种用于视觉语言模型中模态特定和跨模态不确定性的基准

Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 VLM-UQBench通过评估不同UQ方法在模态特定和跨模态不确定性上的表现,揭示了现有方法在细粒度不确定性检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10023 2026-02-11 cs.CL 57%

MEVER: Multi-Modal and Explainable Claim Verification with Graph-based Evidence Retrieval

MEVER:基于图的证据检索的多模态和可解释性声明验证

Delvin Ce Zhang, Suhan Cui, Zhelin Chu, Xianren Zhang, Dongwon Lee

机构 * University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) University of California San Diego(加州大学圣地亚哥分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。

Comments Accepted to EACL-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10017 2026-02-11 cs.CL 57%

SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation

SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估

Homaira Huda Shomee, Rochana Chaturvedi, Yangxinyu Xie, Tanwi Mallick

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09712 2026-02-11 cs.CL 57%

TraceMem: Weaving Narrative Memory Schemata from User Conversational Traces

TraceMem: 从用户对话轨迹编织叙事记忆图式

Yiming Shu, Pei Liu, Tiange Zhang, Ruiyang Gao, Jun Ma, Chen Sun

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nankai University(南开大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TraceMem通过三阶段流程从用户对话轨迹中编织叙事记忆图式,提升多跳和时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09336 2026-02-11 cs.CL 57%

FM SO.P: A Progressive Task Mixture Framework with Automatic Evaluation for Cross-Domain SOP Understanding

FM SO.P: 一种具有自动评估的渐进式任务混合框架用于跨域SOP理解

Siyuan Huang, Ziyu Wang, Chao Pan, Han Zhao

机构 * Amazon(亚马逊) Johns Hopkins University(约翰霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FM SO.P提出了一种渐进式任务混合框架和自动评估系统,以提升跨领域SOP理解的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08268 2026-02-11 cs.AI 57%

Puda: Private User Dataset Agent for User-Sovereign and Privacy-Preserving Personalized AI

Puda:用户主权与隐私保护的个性化AI用户数据代理

Akinori Maeda, Yuto Sekiya, Sota Sugimura, Tomoya Asai, Yu Tsuda, Kohei Ikeda, Hiroshi Fujii, Kohei Watanabe

机构 * Research Institute of Advanced Technology, SoftBank Corp.(软银公司先进科技研究所) Turnt Up Technologies, Inc.(Turnt Up技术公司) TechArts Co., Ltd.(TechArts公司) Acutus Software, Inc.(Acutus软件公司)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Puda通过用户主权架构实现多粒度数据管理,平衡隐私保护与个性化AI的使用需求。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06268 2026-02-11 cs.SE cs.AI 57%

Automated QoR improvement in OpenROAD with coding agents

在OpenROAD中通过编码代理实现自动化QoR提升

Amur Ghose, Junyeong Jang, Andrew B. Kahng, Jakang Lee

机构 * UC San Diego(UC圣地亚哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11362 2026-02-11 cs.LG cs.CV 57%

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

PersonaX: 多模态数据集与LLM推断行为特征

Loka Li, Wong Yu Kang, Minghao Fu, Guangyi Chen, Zhenhao Chen, Gongxu Luo, Yuewen Sun, Salman Khan, Peter Spirtes, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 57%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11239 2026-02-11 cs.LG 57%

Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks

Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试

Wilson Wongso, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09772 2026-02-11 cs.RO 50%

Design and Evaluation of an Assisted Programming Interface for Behavior Trees in Robotics

行为树在机器人中的辅助编程接口设计与评估

Jonathan Styrud, Matteo Iovino, Rebecca Stower, Mart Kartašev, Mikael Norrlöf, Mårten Björkman, Christian Smith

专题命中 推理评测 :planning(abstract)

AI总结 本文提出BETR-GUI,结合AI助手与拖放编辑器,通过整合多种技术提升机器人行为树编程效率,实验证明人类用户优于纯AI助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14622 2026-02-11 cs.DB 50%

Beyond Text-to-SQL: Autonomous Research-Driven Database Exploration with DAR

超越文本到SQL:基于DAR的自主研究驱动数据库探索

Ostap Vykhopen, Viktoria Skorik, Maksym Tereshchenko, Veronika Solopova

专题命中 推理评测 :reasoning(abstract)

AI总结 DAR是一种多代理系统,通过自主探索数据完成端到端数据库研究,显著提升分析效率并生成基于证据的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏