arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-29 至 2026-01-29 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2601.20141 2026-01-29 cs.CY cs.AI 57%

Large language models accurately predict public perceptions of support for climate action worldwide

大型语言模型能准确预测全球对气候行动的支持感知

Nattavudh Powdthavee, Sandra J. Geiger

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 大型语言模型能准确预测全球对气候行动的支持感知,为评估气候行动中的感知差距提供快速工具,尤其在资源丰富的国家可作为替代调查手段。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20102 2026-01-29 cs.CL 57%

Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects

反事实文化线索降低大语言模型医学问答准确性:标识符效应与情境效应

Amirhossein Haji Mohammad Rezaei, Zahra Shakeri

机构 * Institute of Health Policy, Management, and Evaluation (IHPME)(健康政策、管理与评估研究所) Dalla Lana School of Public Health(达拉兰公共卫生学院) University of Toronto(多伦多大学) Faculty of Information(信息学院) Schwartz Reisman Institute(施瓦茨-雷曼研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过反事实文化线索测试,发现文化相关信息显著降低大语言模型医学问答准确性,尤其在标识符与情境共同存在时影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19916 2026-01-29 cs.CL 57%

PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review

PaperAudit-Bench: 用于关键自动化同行评审中研究论文错误检测的基准测试

Songjun Tu, Yiwen Ma, Jiahao Lin, Qichao Zhang, Xiangyuan Lan, Junfeng. Li, Nan Xu, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Wenge Technology(文英科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PaperAudit-Bench通过整合结构化错误检测与证据意识的评审生成,提升自动化同行评审的批判性评估能力,并支持轻量级模型训练以实现高效错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08430 2026-01-29 cs.AI 57%

RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation

RubricHub: 通过自动化粗到细生成构建一个全面且高度判别性的评分标准数据集

Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen

机构 * Li Auto Inc. Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricHub通过自动化粗到细生成方法构建了一个大规模多领域评分标准数据集,通过后训练流程显著提升了模型在HealthBench上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 57%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07286 2026-01-29 cs.CL cs.IR 57%

Arce: Augmented Roberta with Contextualized Elucidations for Ner in Automated Rule Checking

Arce:增强的RoBERTa与上下文澄清用于自动规则检查中的命名实体识别

Jian Chen, Jiabao Dou

机构 * Ningxia Research Institute of Transport Science(宁夏交通运输科学研究院) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ARCE通过增强RoBERTa并结合上下文澄清,有效解决了AEC领域自动规则检查中的命名实体识别问题,实现了77.20%的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 50%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 50%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 6 篇

2501.19180 2026-01-29 cs.CR cs.AI 83%

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11558 2026-01-29 cs.CV cs.AI cs.CL 81%

DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs

DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理

Bo-Cheng Chiu, Jen-Jee Chen, Yu-Chee Tseng, Feng-Chi Chen, An-Zi Yen

机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20270 2026-01-29 cs.CR cs.AI 79%

Eliciting Least-to-Most Reasoning for Phishing URL Detection

诱发最小到最大推理以检测钓鱼网址

Holly Trikilis, Pasindu Marasinghe, Fariza Rashid, Suranga Seneviratne

机构 * University of Sydney(悉尼大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种最小到最大提示框架,通过引入答案敏感性机制提升钓鱼网址检测的推理能力和准确性,优于一次性方法和监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19928 2026-01-29 cs.CL 79%

Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures

迈向大规模推理模型的机制理解:训练、推理与失败的综述

Yi Hu, Jiaqi Gu, Ruxin Wang, Zijun Yao, Hao Peng, Xiaobao Wu, Jianhui Chen, Muhan Zhang, Liangming Pan

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文综述了大规模推理模型的训练、推理及失败机制,旨在揭示其内部运作并为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20641 2026-01-29 cs.AI 57%

Investigating the Development of Task-Oriented Communication in Vision-Language Models

探究视觉-语言模型中以任务为导向的交流发展

Boaz Carmeli, Orr Paradise, Shafi Goldwasser, Yonatan Belinkov, Ron Meir

机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) EPFL(苏黎世联邦理工学院) University of California, Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉-语言模型在协作任务中发展以任务为导向的通信协议的潜力与风险

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20148 2026-01-29 cs.SE cs.LG 57%

LogSieve: Task-Aware CI Log Reduction for Sustainable LLM-Based Analysis

LogSieve: 任务感知的CI日志缩减以实现基于大语言模型的可持续分析

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) Faculty of Information University of Toronto Toronto Ontario Ontario(信息学院多伦多大学多伦多安大略安大略) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 LogSieve通过任务感知的日志缩减技术,有效减少CI日志体积并提升大语言模型推理的可持续性与可解释性。

Comments Preprint. Accepted for presentation at Mining Software Repositories (MSR'26), co-located ICSE 2026. The final version will appear in the ACM Digital Library as part of the MSR'26 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏