arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-22 至 2025-12-22 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2512.16969 2025-12-22 cs.AI cs.CL cs.LG 67%

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

通过科学家对齐的工作流探测大语言模型的科学通用智能

Wanghan Xu, Yuhao Zhou, Yifan Zhou, Qinglong Cao, Shuo Li, Jia Bu, Bo Liu, Yixin Chen, Xuming He, Xiangyu Zhao, Xiang Zhuang, Fengxiang Wang, Zhiwang Zhou, Qiantai Feng, Wenxuan Huang, Jiaqi Wei, Hao Wu, Yuejin Yang, Guangshuai Wang, Sheng Xu, Ziyan Huang, Xinyao Liu, Jiyao Liu, Cheng Tang, Wei Li, Ying Chen, Junzhi Ning, Pengfei Jiang, Chenglong Ma, Ye Du, Changkai Ji, Huihui Xu, Ming Hu, Jiangbin Zheng, Xin Chen, Yucheng Wu, Feifei Jiang, Xi Chen, Xiangru Tang, Yuchen Fu, Yingzhou Lu, Yuanyuan Zhang, Lihao Sun, Chengbo Li, Jinzhe Ma, Wanhao Liu, Yating Liu, Kuo-Cheng Wu, Shengdu Chai, Yizhou Wang, Ouwen Zhangjin, Chen Tang, Shufei Zhang, Wenbo Cao, Junjie Ren, Taoyong Cui, Zhouheng Yao, Juntao Deng, Yijie Sun, Feng Liu, Wangxu Wei, Jingyi Xu, Zhangrui Li, Junchao Gong, Zijie Guo, Zhiyu Yao, Zaoyu Chen, Tianhao Peng, Fangchen Yu, Bo Zhang, Dongzhan Zhou, Shixiang Tang, Jiaheng Liu, Fenghua Ling, Yan Lu, Yuchen Ren, Ben Fei, Zhen Zhao, Xinyu Gu, Rui Su, Xiao-Ming Wu, Weikang Si, Yang Liu, Hao Chen, Xiangchao Yan, Xue Yang, Junchi Yan, Jiamin Wu, Qihao Zheng, Chenhui Li, Zhiqiang Gao, Hao Kong, Junjun He, Mao Su, Tianfan Fu, Peng Ye, Chunfeng Song, Nanqing Dong, Yuqiang Li, Huazhu Fu, Siqi Sun, Lijing Cheng, Jintai Lin, Wanli Ouyang, Bowen Zhou, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 62%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16962 2025-12-22 cs.CR cs.AI cs.LG 62%

MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval

MemoryGraft: 通过中毒经验检索持续破坏LLM代理

Saksham Sahai Srivastava, Haoyu He

机构 * School of Computing University of Georgia(计算机学院 佐治亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MemoryGraft 通过在LLM代理的长期记忆中植入恶意经验,实现对代理行为的持续破坏。

Comments 14 pages, 1 figure, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12218 2025-12-22 cs.CV cs.CL cs.LG 62%

Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking

目的地之前:视觉忠实性在慢思考中的重要性

Rheeya Uppaal, Phu Mon Htut, Min Bai, Nikolaos Pappas, Zheng Qi, Sandesh Swamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS AI Labs(AWS人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出视觉忠实性评估方法,通过检测并修正不忠实的感知步骤提升多模态推理的可靠性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21791 2025-12-22 cs.CL cs.LG 62%

Quantifying the Impact of Structured Output Format on Large Language Models through Causal Inference

通过因果推理量化结构化输出格式对大语言模型的影响

Han Yuan, Yue Zhao, Li Zhang, Wuqiong Luo, Zheng Ma

机构 * Global Decision Science, American Express(全球决策科学,美国运通)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过因果推理分析结构化输出对大语言模型生成的影响,发现多数情况下无显著因果效应,但特定情况下受指令影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20915 2025-12-22 cs.CR cs.AI cs.LG 62%

ZKPROV: A Zero-Knowledge Approach to Dataset Provenance for Large Language Models

ZKPROV: 一种用于大语言模型数据溯源的零知识方法

Mina Namazi, Alexander Nemecek, Erman Ayday

机构 * Open University of Catalonia(加泰罗尼亚开放大学) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 ZKPROV通过零知识证明实现大语言模型的数据溯源验证,保障数据隐私与效率平衡,适用于医疗等敏感领域。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17677 2025-12-22 cs.CL 57%

Toward Ethical AI Through Bayesian Uncertainty in Neural Question Answering

通过贝叶斯不确定性实现伦理AI:神经问答中的贝叶斯推理

Riccardo Di Sipio

机构 * Dayforce

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过贝叶斯不确定性方法改进神经问答系统的可解释性和伦理性,对比拉普拉斯近似与MAP估计以提升不确定性校准能力。

Comments 14 pages, 8 figures,

Journal ref AI Ethics 6, 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 57%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 57%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 50%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21540 2025-12-22 cs.HC 50%

Designing an LLM-Based Behavioral Activation Chatbot for Young People with Depression: Insights from an Evaluation with Artificial Users and Clinical Experts

设计一个基于LLM的行为激活聊天机器人以帮助有抑郁症的青少年:基于人工用户和临床专家评估的见解

Florian Onur Kuhlmeier, Leon Hanschmann, Melina Rabe, Stefan Luettke, Eva-Lotta Brakemeier, Alexander Maedche

专题命中 推理评测 :reasoning(abstract)

AI总结 本文设计了一个基于LLM的行为激活聊天机器人,通过人工用户和临床专家评估,验证了其在抑郁症干预中的保真度和安全性,同时指出临床推理能力仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 50%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 50%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 推理评测 :reasoning(abstract)

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 7 篇

2512.17108 2025-12-22 cs.LG cs.MM 57%

Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse

Atom:通过模块化重用实现高效的设备端视频-语言流水线

Kunjal Panchal, Saayan Mitra, Somdeb Sarkhel, Haoliang Wang, Ishita Dasgupta, Gang Wu, Hui Guan

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Atom通过模块化重用提升设备端视频-语言流水线效率,实现27-33%的执行速度提升,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17060 2025-12-22 cs.MA cs.AI 57%

On the Role of Contextual Information and Ego States in LLM Agent Behavior for Transactional Analysis Dialogues

在交易分析对话中LLM代理行为中情境信息和自我状态的作用

Monika Zamojska, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology(电子与信息技术学院) Warsaw University of Technology(华沙技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种受交易分析理论启发的多代理系统,通过整合情境信息检索来增强LLM代理在交易分析对话中的行为真实性。

Comments Presented at the 39th Pacific Asia Conference on Language, Information and Computation (PACLIC 39)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17041 2025-12-22 cs.AI cs.SY eess.SY 57%

Security Risks of Agentic Vehicles: A Systematic Analysis of Cognitive and Cross-Layer Threats

代理车辆的安全风险:对认知和跨层威胁的系统分析

Ali Eslami, Jiangbo Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于角色的架构,分析代理车辆中认知和跨层安全威胁,提供首个结构化分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18686 2025-12-22 cs.LG 57%

Hierarchical Multimodal LLMs with Semantic Space Alignment for Enhanced Time Series Classification

具有语义空间对齐的层次多模态大语言模型用于增强的时间序列分类

Xiaoyu Tao, Tingyue Pan, Mingyue Cheng, Yucong Luo, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 HiTime通过层次多模态大语言模型和语义空间对齐,提升时间序列分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17640 2025-12-22 cs.CV 50%

Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs

通过可微认知引导的多模态大语言模型进行生成式人类-物体交互检测

Zhaolin Cai, Huiyu Duan, Zitong Xu, Fan Li, Zhi Liu, Jing Liu, Wei Shen, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) Xi’an Jiao Tong University(西安交通大学) Shandong University(山东大学) Tianjin University(天津大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出GRASP-HO框架,通过可微认知引导的多模态大语言模型实现生成式人类-物体交互检测,解决封闭集分类与开放词汇生成之间的监督不匹配问题,实现判别感知与生成推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17455 2025-12-22 cs.SE 50%

An Investigation on How AI-Generated Responses Affect SoftwareEngineering Surveys

对AI生成响应如何影响软件工程调查的探究

Ronnie de Souza Santos, Italo Santos, Maria Teresa Baldassarre, Cleyton Magalhaes, Mairieli Wessel

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究探讨AI生成响应对软件工程调查的影响,通过分析发现49份回答存在合成作者身份的模式,强调需结合自动化与解释性验证以提升调查可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09116 2025-12-22 cs.CV 50%

Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention

零shot分层植物分割:通过基础分割模型和文本到图像注意力

Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura

机构 * The University of Osaka(大阪大学) Phytometrics Nagoya University(名古屋大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 ZeroPlantSeg通过基础分割模型和文本到图像注意力实现零shot分层植物分割,有效提取植物个体,优于现有方法。

Comments WACV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏