arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-16 至 2026-02-16 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2508.08275 2026-02-16 cs.CL cs.AI 86%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12968 2026-02-16 cs.IR cs.AI cs.CL 81%

RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems

RGAlign-Rec: 基于排名引导的潜在查询推理中的对齐方法

Junhua Liu, Yang Jihao, Cheng Chang, Kunrong LI, Bin Fu, Kwan Hui Lim

机构 * Forth AI Singapore(Forth AI新加坡) Shopee Singapore(Shopee新加坡) Singapore Uni. of Tech. and Design(新加坡技术与设计大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RGAlign-Rec通过闭环对齐框架结合语义推理和增强查询模型,提升电子商务推荐系统的预测准确性和服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 81%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 79%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14746 2026-02-16 cs.LG 79%

MissionHD: Hyperdimensional Refinement of Distribution-Deficient Reasoning Graphs for Video Anomaly Detection

MissionHD: 分布匮乏的推理图超维度细化用于视频异常检测

Sanggeon Yun, Raheeb Hassan, Ryozo Masukawa, Nathaniel D. Bastian, Mohsen Imani

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维奇分校) Department of Electrical Engineering & Computer Science United States Military Academy, West Point(电气工程与计算机科学系美国军事学院西点分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MissionHD通过超维度计算优化任务对齐的图表示,提升视频异常检测与识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12530 2026-02-16 cs.IR 78%

Reasoning to Rank: An End-to-End Solution for Exploiting Large Language Models for Recommendation

推理以排序:一种利用大语言模型进行推荐的端到端解决方案

Kehan Zheng, Deyao Hong, Qian Li, Jun Zhang, Huan Yu, Jie Jiang, Hongning Wang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种端到端的推荐框架,通过强化学习优化大语言模型的推理过程,以提高推荐系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12617 2026-02-16 cs.AI 77%

GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics

GeoAgent: 通过强化地理特征实现全方位定位学习

Modi Jin, Yiming Zhang, Boyuan Sun, Dingwen Zhang, MingMing Cheng, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 GeoAgent通过引入地理相似性奖励和一致性奖励,结合专家标注的地理定位数据,提升模型在多粒度上的定位性能和推理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12665 2026-02-16 cs.AI 74%

Evaluating Robustness of Reasoning Models on Parameterized Logical Problems

评估参数化逻辑问题上推理模型的鲁棒性

Naïm Es-sebbani, Esteban Marquer, Yakoub Salhi, Zied Bouraoui

机构 * CRIL UMR 8188, Univ Artois, CNRS, France(CRIL UMR 8188,阿维尼翁大学,法国国家科学研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出了一种针对2-SAT的诊断基准,用于评估推理模型在参数化逻辑问题上的鲁棒性,通过隔离不同能力与失败模式,揭示模型在结构干预下的性能变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08543 2026-02-16 cs.CL cs.AI cs.IR 73%

GISA: A Benchmark for General Information-Seeking Assistant

GISA:通用信息检索助手的基准测试

Yutao Zhu, Xingshuo Zhang, Maosen Zhang, Jiajie Jin, Liancheng Zhang, Xiaoshuai Song, Kangzhi Zhao, Wencong Zeng, Ruiming Tang, Han Li, Ji-Rong Wen, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 GISA是一个针对通用信息检索助手的基准测试,包含373个人工设计的查询,旨在评估信息检索任务中深度推理与信息聚合的能力。

Comments Project repo: https://github.com/RUC-NLPIR/GISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 70%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05794 2026-02-16 cs.AI cs.CE cs.CL cs.LG 67%

FiMI: A Domain-Specific Language Model for Indian Finance Ecosystem

FiMI:面向印度金融生态的领域专用语言模型

Aboli Kathar, Aman Kumar, Anusha Kamath, Araveeti Srujan, Ashish Sharma, Chandra Bhushan, Divya Sorate, Duddu Prasanth Kumar, Evan Acharya, Harsh Sharma, Hrithik Kadam, Kanishk Singla, Keyur Doshi, Kiran Praveen, Kolisetty Krishna SK, Krishanu Adhikary, Lokesh MPT, Mayurdeep Sonowal, Nadeem Shaikh, Navya Prakash, Nimit Kothari, Nitin Kukreja, Prashant Devadiga, Rakesh Paul, Ratanjeet Pratap Chauhan, Raunak Kalani, Raviraj Joshi, Shamanth MH, Shantanu Pandey, Shubham Soni, Siddharth Dixit, Smriti Jopat, Sunil Patel, Suraj Singh, Suvradip Paul, Tulasi Pilla, Utkarsh Vaidya, Vineeth Nambiar, Vishal Kanvaty, Yatharth Dedhia

机构 * National Payments Corporation of India (NPCI)(印度国家支付公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FiMI是印度国家支付清算公司为数字支付系统开发的领域专用金融语言模型,通过多阶段训练在金融推理和工具调用任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12892 2026-02-16 cs.CV cs.AI cs.CL 62%

RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training

RADAR: 揭示多模态大语言模型预训练中能力的非对称发展

Yunshuang Nie, Bingqian Lin, Minzhe Niu, Kun Xiang, Jianhua Han, Guowei Huang, Xingyue Quan, Hang Xu, Bokui Chen, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司) Huawei’s 2012 Lab(华为2012实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RADAR提出了一种高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中感知和推理能力的非对称发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 62%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13059 2026-02-16 cs.CL 57%

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

TraceBack: 多智能体分解用于细粒度表格归因

Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TraceBack通过多智能体框架实现细粒度表格归因,提供可验证的单元格支持证据,提升问题回答的透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12919 2026-02-16 cs.CV cs.AI cs.NE 57%

EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition

EPRBench: 一种高质量的基于事件流的视觉位置识别基准数据集

Xiao Wang, Xingxing Xiong, Jinfeng Gao, Xufeng Lou, Bo Jiang, Si-bao Chen, Yaowei Wang, Yonghong Tian

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EPRBench提出了一种高质量的基于事件流的视觉位置识别基准数据集,结合LLM生成场景描述与多模态融合方法,提升位置识别的准确性和模型透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10915 2026-02-16 cs.CR cs.AI 57%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08236 2026-02-16 cs.CL cs.CY 57%

Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge

通过LLM-as-Judge探索LLM在中文心理健康对话中的安全对齐评估

Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

机构 * HKUST(GZ)(香港科技大学(广州)) Wuhan Univ.(武汉大学) Univ. of Iowa(爱荷华大学) Univ. of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PsyCrisis-Bench,通过LLM-as-Judge方法评估LLM在中文心理健康对话中的安全对齐性,提供高质量数据集和可解释的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 50%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12877 2026-02-16 cs.CV 50%

RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads

RoadscapesQA: 一个用于印度道路视觉问答的多任务、多模态数据集

Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

专题命中 推理评测 :reasoning(abstract)

AI总结 RoadscapesQA数据集通过多任务多模态方法,为印度道路场景的视觉问答提供支持,包含9000张图像及手动标注的边界框,用于提升无结构环境下的视觉场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12820 2026-02-16 eess.IV cs.CV 50%

3DLAND: 3D Lesion Abdominal Anomaly Localization Dataset

3DLAND:3D 腹部病变异常定位数据集

Mehran Advand, Zahra Dehghanian, Navid Faraji, Reza Barati, Seyed Amir Ahmad Safavi-Naini, Hamid R. Rabiee

专题命中 推理评测 :reasoning(abstract)

AI总结 3DLAND数据集通过大规模3D病变注释和多器官覆盖,为评估器官感知的3D分割模型提供新基准,推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏