arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 224 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 72 篇

2601.12505 2026-01-21 cs.CL 57%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12473 2026-01-21 cs.CL 57%

Capability-Aware Early-Stage Research Idea Evaluation

具备能力的早期研究想法评估

Renlong Jie, Chen Chu, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) School of Statistics and Mathematics(统计与数学学院) iOPEN

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出一种基于能力的框架,通过作者信息和研究想法预测论文接受情况,无需完整文本或实验结果,显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12392 2026-01-21 cs.AI 57%

PsychēChat: An Empathic Framework Focused on Emotion Shift Tracking and Safety Risk Analysis in Psychological Counseling

PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架

Zhentao Xia, Yongqi Fan, Yuxiang Chu, Yichao Yin, Liangliang Chen, Tong Ruan, Weiyan Zhang

机构 * East China University of Science and Technology(东华大学) Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19423 2026-01-21 cs.AI 57%

ETOM: A Five-Level Benchmark for Evaluating Tool Orchestration within the MCP Ecosystem

ETOM:一种用于评估MCP生态系统内工具编排的五级基准

Jia-Kai Dong, I-Wei Huang, Chun-Tin Wu, Yi-Tien Tsai

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 ETOM提出了一种五级基准,用于评估LLM代理在MCP生态系统中进行多跳工具编排的能力,通过构建等效功能集提供客观指标,揭示代理在鲁棒性和复杂任务中的系统性弱点。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08341 2026-01-21 cs.AI cs.MA q-bio.GN 57%

Benchmarking AI scientists for omics data driven biological discovery

对驱动生物发现的生物信息学数据的AI科学家进行基准测试

Erpai Luo, Jinmeng Jia, Yifan Xiong, Xiangyu Li, Xiaobo Guo, Baoqi Yu, Minsheng Hao, Lei Wei, Xuegong Zhang

机构 * MOE Key Laboratory of Bioinformatics(生物信息学国家重点实验室) Bioinformatics Division of BNRIST, Department of Automation(生物信息学部) Tsinghua University(清华大学) School of Software Engineering(软件学院) Beijing Jiaotong University(北京交通大学) Department of Physiology and Pathophysiology, School of Basic Medical Sciences(基础医学学院生理与病理生理学系) Capital Medical University(首都医科大学) Center for Synthetic and Systems Biology, School of Life Sciences and School of Medicine(合成与系统生物学中心,生命科学学院,医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BAISBench通过评估AI科学家在单细胞转录组数据上的表现,推动生物发现的AI研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-01-21 cs.CL 57%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Yingjie He, Zhaolu Kang, Kehan Jiang, Qianyuan Zhang, Jiachen Qian, Chunlei Meng, Yujie Feng, Yuan Wang, Jiabao Dou, Aming Wu, Leqi Zheng, Pengxiang Zhao, Jiaxin Liu, Zeyu Zhang, Lei Wang, Guansu Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05080 2026-01-21 cs.CL 57%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00332 2026-01-21 cs.AI cs.CE 57%

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

当幻觉成本百万:在高风险对抗性金融市场中基准测试AI代理

Zeshi Dai, Zimo Peng, Zerui Cheng, Ryan Yihe Li

机构 * Surf AI, Cybertino Lab(Surf AI,Cybertino 实验室) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAIA基准测试揭示了AI在对抗性金融市场中的能力缺口,指出当前模型在面对虚假信息和不可逆决策时表现不佳,强调对抗鲁棒性对可信AI的重要性。

Comments 15 pages, 5 figures, 4 tables; Accepted to AAAI 2026 (AI-4-Finance Workshop - Oral, top 10%); In submission to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24294 2026-01-21 cs.CL cs.HC 57%

LOGOS: LLM-driven End-to-End Grounded Theory Development and Schema Induction for Qualitative Research

LOGOS: 基于大语言模型的端到端 grounded theory 开发与模式诱导用于定性研究

Xinyu Pi, Qisen Yang, Chuong Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LOGOS 是一种基于大语言模型的端到端框架,通过自动化 grounded theory 工作流程,实现定性研究的结构化理论开发和模式诱导,显著提升了研究的可扩展性和理论精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16101 2026-01-21 cs.AI cs.IR 57%

Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals

比零样本更差?一个评估RAG在误导检索中鲁棒性的事实核查数据集

Linda Zeng, Rithwik Gupta, Divij Motwani, Yi Zhang, Diji Yang

机构 * The Harker School(哈克尔学校) Irvington High School(艾尔文顿高中) Palo Alto High School(帕洛阿尔托高中) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RAGuard是首个评估RAG系统在误导检索中鲁棒性的基准,揭示LLM在面对误导信息时的表现劣于零样本基线。

Comments Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 50%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13702 2026-01-21 cs.NI 50%

IGAA: Intent-Driven General Agentic AI for Edge Services Scheduling using Generative Meta Learning

IGAA: 基于生成元学习的意图驱动通用代理AI用于边缘服务调度

Yan Sun, Yinqiu Liu, Shaoyong Guo, Ruichen Zhang, Feng Qi, Xuesong Qiu, Weifeng Gong, Dusit Niyato, Qihui Wu

专题命中 推理评测 :reasoning(abstract)

AI总结 IGAA通过生成元学习和意图驱动机制,提升边缘服务调度的泛化能力与适应性,有效应对动态服务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13682 2026-01-21 cs.SE cs.PL 50%

CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation

CodeContests-O: 通过反馈驱动的迭代测试用例生成增强大语言模型

Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou, Houqiang Li

专题命中 推理评测 :reasoning(abstract)

AI总结 通过反馈驱动的迭代测试用例生成框架,提升大语言模型的验证质量,构建高质量的CodeContests-O数据集,显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13539 2026-01-21 cs.SD 50%

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

LongSpeech: 一种可扩展的基准,用于长语音的转录、翻译和理解

Fei Yang, Xuanfan Ni, Renyi Yang, Jiahui Geng, Qing Li, Chenyang Lyu, Yichao Du, Longyue Wang, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) Shanghai Jiao Tong University(上海交通大学) Delft University of Technology(代尔夫特理工大学) Linköping University(林肯大学) University of Groningen(格罗宁根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 LongSpeech是一个大规模可扩展的语音基准,旨在评估和推动语音模型在长音频转录、翻译和理解上的能力,揭示了现有模型在多任务和高阶推理上的不足。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 50%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-01-21 cs.CV 50%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Zijian Chen, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12826 2026-01-21 cs.CV 50%

Seeing Isn't Always Believing: Analysis of Grad-CAM Faithfulness and Localization Reliability in Lung Cancer CT Classification

看见不总是相信:肺癌CT分类中Grad-CAM可信度与局部化可靠性的分析

Teerapong Panboonyuen

机构 * Chulalongkorn University(朱拉隆功大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究分析了Grad-CAM在肺癌CT分类中的可信度与局部化可靠性,揭示了其在不同模型中的表现差异及局限性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12652 2026-01-21 cs.CY 50%

Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking

大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估

Chutian Huang, Dake Cao, Jiacheng Ji, Yunlou Fan, Chengze Yan, Hanhui Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21772 2026-01-21 econ.GN q-fin.EC 50%

A Unified Metric Architecture for AI Infrastructure: A Cross-Layer Taxonomy Integrating Performance, Efficiency, and Cost

面向AI基础设施的统一度量架构:整合性能、效率和成本的跨层分类

Qi He

专题命中 推理评测 :planning(abstract)

AI总结 本文提出统一度量架构,整合性能、效率和成本,通过跨层分类和分解,建立6x3分类学以优化AI基础设施的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14880 2026-01-21 cs.SD 50%

From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition

从 hype 到 insight:重新思考大型语言模型在视觉语音识别中的整合

Rishabh Jain, Naomi Harte

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过系统评估发现,LLM解码器通过优化上下文推理提升性能,而非依赖视觉特征,强调需强化视觉编码器以推动VSR进展。

Comments Accepted for publication in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 50%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11540 2026-01-21 cs.HC 50%

Exploring General-Purpose Autonomous Multimodal Agents for Pathology Report Generation

探索通用型自主多模态代理用于病理报告生成

Marc Aubreville, Taryn A. Donovan, Christof A. Bertram

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。

Comments 6 pages, 1 figure, accepted paper for BVM 2026

Journal ref BVM 2026, https://bvm-conf.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11537 2026-01-21 cs.HC 50%

Building AI-based advisory services for smallholder farmers: Technical learnings from the AIEP Initiative

为小农户建设基于AI的咨询服务:AIEP计划的技术经验

Stewart Collis, Florence Kinyua, Vikram Kumar, Howard Lakougna, Christian Merz, Kirti Pandey, Christian Resch

专题命中 推理评测 :reasoning(abstract)

AI总结 AIEP计划通过AI技术为小农户提供农业咨询服务,发现多语言语音交互和语料库编纂是关键挑战,同时强调数据共享和评估基准的重要性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11525 2026-01-21 cs.HC 50%

PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries

PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库

Yi Zhao, Zhen Yang, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。

Comments 30 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 50%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 19 篇

2601.13653 2026-01-21 cs.LG 79%

TimeART: Towards Agentic Time Series Reasoning via Tool-Augmentation

TimeART: 通过工具增强实现代理时间序列推理

Xingjian Wu, Junkai Lu, Zhengyu Li, Xiangfei Qiu, Jilin Hu, Chenjuan Guo, Christian S. Jensen, Bin Yang

机构 * East China Normal University, Shanghai, China(华东师范大学) Aalborg University, Aalborg, Denmark(奥胡斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 TimeART通过融合强大工具的分析能力与LLM的推理能力,实现时间序列问题回答的自主代理方法,通过四阶段训练策略提升模型泛化能力,并在多个任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06860 2026-01-21 cs.AI 79%

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration

ET-Agent:通过行为校准激励有效的工具集成推理代理

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ET-Agent通过自我进化数据飞轮和行为校准训练框架,提升工具集成推理代理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 77%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13630 2026-01-21 cs.CL 74%

Activation-Space Anchored Access Control for Multi-Class Permission Reasoning in Large Language Models

基于激活空间锚定的多类权限推理访问控制

Zhaopeng Zhang, Pengcheng Sun, Lan Zhang, Chen Tang, Jiewei Lai, Yunhao Wang, Hui Jin

机构 * University of Science and Technology of China(中国科学技术大学) Lenovo Research(联想研究院)

专题命中 其他推理 :reasoning(title);分类 cs.CL

AI总结 本文提出AAAC框架,通过激活空间锚点实现多类权限控制,有效降低权限违规和攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20776 2026-01-21 cs.CL cs.AI cs.LG 67%

SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences

SpecExtend: 为长序列推测解码的即插即用增强

Jungyoub Cha, Hyunjong Kim, Sungzoon Cho

机构 * Seoul National University(首尔国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SpecExtend通过集成高效注意力机制和Cross-model Retrieval策略,提升长序列推测解码效率,加速文档摘要和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏