arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 86 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2601.16503 2026-02-12 cs.CL cs.AI 62%

MRAG: Benchmarking Retrieval-Augmented Generation for Bio-medicine

MRAG:生物医学领域检索增强生成的基准测试

Liz Li, Wei Zhu

机构 * DataSelect AI University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MRAG基准测试通过构建医学领域语料库和工具包,评估RAG在生物医学任务中的有效性,揭示RAG在提升LLM可靠性及性能影响因素方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23050 2026-02-12 cs.LG cs.AI 62%

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比嵌入链理解LVLMs的语言先验

Lin Long, Changdae Oh, Seongheon Park, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17512 2026-02-12 cs.AI cs.CL 62%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00036 2026-02-12 nlin.CG cs.AI cs.FL cs.NE 57%

LOGOS-CA: A Cellular Automaton Using Natural Language as State and Rule

LOGOS-CA: 一种使用自然语言作为状态和规则的细胞自动机

Keishu Utimula

机构 * Keishu Utimula(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LOGOS-CA利用自然语言作为细胞自动机的状态和规则,通过LLM实现更新,拓展了细胞自动机的模拟能力,用于森林火灾模拟和人工生命研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 57%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 57%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 57%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05892 2026-02-12 cs.LG 57%

ContextBench: A Benchmark for Context Retrieval in Coding Agents

ContextBench: 一种用于编码代理代码上下文检索的基准测试

Han Li, Letian Zhu, Bohan Zhang, Rili Feng, Jiaming Wang, Yue Pan, Earl T. Barr, Federica Sarro, Zhaoyang Chu, He Ye

机构 * Nanjing University(南京大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。

Comments 36 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10518 2026-02-12 cs.CV 50%

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps

MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试

Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta

机构 * University of Southern California(南加州大学) University of California Los Angeles(加州大学洛杉矶分校) University of Utah(犹他大学) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16471 2026-02-12 cs.CV 50%

Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos

秩序从混沌:从 glitchy 游戏视频中理解物理世界

Meng Cao, Haoran Tang, Haoze Zhao, Mingfei Han, Ruyang Liu, Qiang Sun, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Toronto(多伦多大学) Sun Yat-sen University(孙中山大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 16 篇

2510.01304 2026-02-12 cs.AI cs.CL 81%

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

代理拼图交互学习:提升视觉感知与推理能力在视觉-语言模型中

Yu Zeng, Wenxuan Huang, Shiting Huang, Xikun Bao, Yukun Qi, Yiming Zhao, Qiuchen Wang, Lin Chen, Zehui Chen, Huaian Chen, Wanli Ouyang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AGILE通过代理拼图交互学习提升视觉-语言模型的感知与推理能力,显著提高拼图任务性能并增强多模态模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10560 2026-02-12 cs.CL cs.AI 81%

When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning

何时记忆何时停止:用于长上下文推理的门控循环记忆

Leheng Sheng, Yongtao Zhang, Wenchang Ma, Yaorui Shi, Ting Huang, Xiang Wang, An Zhang, Ke Shen, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GRU-Mem通过引入两个文本控制的门,实现了更稳定和高效的长上下文推理,显著提升了推理速度和性能。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10138 2026-02-12 cs.CV cs.AI cs.CL cs.LG 67%

Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement

多模态信息融合用于图表理解:MLLMs的综述——演变、局限与认知增强

Zhihang Yi, Jian Zhao, Jiancheng Lv, Tao Wang

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Engineering Research Center of Machine Learning(机器学习工程研究中心) China Telecom Institute of AI(中国电信人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了多模态大语言模型在图表理解中的应用,分析了其演变、局限及未来发展方向,旨在推动更稳健的系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14671 2026-02-12 cs.CL cs.AI cs.LG 67%

TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding

TableDART: 表格理解的动态自适应多模态路由

Xiaobo Xing, Wei Yuan, Tong Chen, Quoc Viet Hung Nguyen, Xiangliang Zhang, Hongzhi Yin

机构 * The University of Queensland, Australia(昆士兰大学) Griffith University, Australia(格里菲斯大学) University of Notre Dame, USA(诺丁汉大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TableDART通过动态选择文本、图像或融合视角,提升表格理解的准确性和效率,避免昂贵的多模态模型微调。

Comments Accepted to ICLR 2026. 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23798 2026-02-12 cs.CL cs.AI cs.CV 62%

Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models

揭示'公平性之锯':在视觉-语言模型中发现并缓解性别和种族偏见

Jian Lan, Udo Schlegel, Tanveer Hannan, Gengyuan Zhang, Haokun Chen, Thomas Seidl

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RES-FAIR框架,通过调整隐藏状态缓解视觉-语言模型中的性别和种族偏见,提升响应公平性和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10224 2026-02-12 cs.LG cs.AI 62%

Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models

将元经验内化到记忆中以指导大语言模型的强化学习

Shiting Huang, Zecheng Li, Yu Zeng, Qingnan Ren, Zhen Fang, Qisheng Su, Kou Shi, Lin Chen, Zehui Chen, Feng Zhao

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过将元经验内化到记忆中,MEL提升了大语言模型的强化学习效果,实现了更有效的知识重用和推理能力增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09821 2026-02-12 cs.CL cs.AI 62%

Text summarization via global structure awareness

通过全局结构意识进行文本摘要

Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Yibei Liu, Chenghao Li, Qigan Sun, Shuai Yuan, Fachrina Dewi Puspitasari, Dongshen Han, Guoqing Wang, Sung-Ho Bae, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GloSA-sum通过拓扑数据分析实现全局结构意识,高效摘要的同时保留语义和逻辑依赖,提升长文本处理效率和下游任务表现。

Comments 24pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04215 2026-02-12 cs.RO cs.AI cs.LG 62%

OAT: Ordered Action Tokenization

OAT:有序动作标记化

Chaoqi Liu, Xiaoshen Han, Jiawei Gao, Yue Zhao, Haonan Chen, Yilun Du

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 OAT通过有序动作标记化方法,实现高压缩性和因果有序的标记空间,提升机器人动作生成的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09200 2026-02-12 cs.CL cs.AI 62%

A.X K1 Technical Report

A.X K1 技术报告

Sung Jun Cheon, Jaekyung Cho, Seongho Choi, Hyunjun Eun, Seokhwan Jo, Jaehyun Jun, Minsoo Kang, Jin Kim, Jiwon Kim, Minsang Kim, Seungsik Kim, Sungwan Kim, Tae Yoon Kim, Youngrang Kim, Hyeongmun Lee, Sangyeol Lee, Sungeun Lee, Youngsoon Lee, Yujin Lee, Seongmin Ok, Chanyong Park, Hyewoong Park, Junyoung Park, Hyunho Yang, Subin Yi, Dhammiko Arya, Soohyun Bae, Dongyeon Cho, Seungmo Cho, Sangho Choi, Yongseok Choi, Gyoungeun Han, Yong-jin Han, Seokyoung Hong, Hyeon Hwang, Wonbeom Jang, Minjeong Ju, Wonjin Jung, Keummin Ka, Sungil Kang, Dongnam Kim, Jonghwi Kim, Joonghoon Kim, SaeRom Kim, Sangjin Kim, Seongwon Kim, Youngjin Kim, Seojin Lee, Sunwoo Lee, Taehoon Lee, Chanwoo Park, Sohee Park, Sooyeon Park, Yohan Ra, Sereimony Sek, Seungyeon Seo, Gun Song, Sanghoon Woo, Janghan Yoon, Sungbin Yoon

机构 * SK Telecom(SK电信)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 A.X K1 是一个5190亿参数的混合专家语言模型,通过Think-Fusion训练配方实现可控推理,具备在韩语基准测试中优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11128 2026-02-12 cs.LG 57%

Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards

可验证奖励下的强化学习中不对称提示加权

Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出不对称提示加权方法,用于提升可验证奖励强化学习中低成功率提示的训练效率,尤其在从头开始的强化学习中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11057 2026-02-12 cs.LG 57%

Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models

分割、调和、然后征服:利用多模态语言模型解决多商品流问题

Xinyu Yuan, Yan Qiao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学) Co-corresponding authors(共同通讯作者)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Pram利用多模态语言模型解决多商品流问题,通过分解和调和子问题实现高效优化,性能接近线性规划求解器且运行时间显著降低。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10819 2026-02-12 cs.LG 57%

RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization

RePO:通过重新表述策略优化弥合基于策略学习和基于策略知识的差距

Linxuan Xia, Xiaolong Yang, Yongyuan Chen, Enyue Zhao, Deng Cai, Yasheng Wang, Boxi Wu

机构 * State Key Laboratory of CAD\&CG, the College of Computer Science Technology, Zhejiang University. FiT, Tencent, Shenzhen, China. School of Software Technology, Zhejiang University

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 RePO通过重新表述策略优化,有效结合基于策略学习和基于策略知识,提升困难样本利用和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00389 2026-02-12 cs.AI 57%

CyberBOT: Towards Reliable Cybersecurity Education via Ontology-Grounded Retrieval Augmented Generation

CyberBOT: 通过基于本体的检索增强生成实现可靠的网络安全教育

Chengshuai Zhao, Riccardo De Maria, Tharindu Kumarage, Kumar Satvik Chaudhary, Garima Agrawal, Yiwen Li, Jongchan Park, Yuli Deng, Ying-Chih Chen, Huan Liu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CyberBOT通过基于本体的检索增强生成技术,提供可靠的网络安全教育解决方案,提升教学效果和学生参与度。

Comments Accepted by The Conference on Information and Knowledge Management (CIKM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10133 2026-02-12 cs.SE cs.AI 57%

AgentTrace: A Structured Logging Framework for Agent System Observability

AgentTrace: 一种面向智能体系统的结构化日志框架用于可观测性

Adam AlSayyad, Kelvin Yuxiang Huang, Richik Pal

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 AgentTrace是一种面向智能体系统的结构化日志框架,旨在通过动态可观测性和遥测功能提升智能体的安全性和可追溯性。

Comments AAAI 2026 Workshop LaMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10684 2026-02-12 cs.HC 50%

Privacy Control in Conversational LLM Platforms: A Walkthrough Study

对话式大语言模型平台中的隐私控制:一项 walkthrough 研究

Zhuoyang Li, Yanlai Wu, Yao Li, Xinning Gui, Yuhan Luo

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究对话式大语言模型平台的数据控制机制,揭示用户数据生成与共享的复杂性,并为开发者和政策制定者提供隐私控制优化的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10399 2026-02-12 cs.RO 50%

LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies

LocoVLM:为适应多功能腿式运动策略而 grounding 视觉和语言

I Made Aswin Nahrendra, Seunghyun Lee, Dongkyu Lee, Hyun Myung

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 其他推理 :reasoning(abstract)

AI总结 LocoVLM通过整合高层常识推理和视觉语言模型,实现了基于指令的实时腿式运动策略适应,准确率达87%。

Comments Project page: https://locovlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏