arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-19 至 2026-01-19 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2601.10983 2026-01-19 cs.CY 82%

Evaluating 21st-Century Competencies in Postsecondary Curricula with Large Language Models: Performance Benchmarking and Reasoning-Based Prompting Strategies

利用大语言模型评估21世纪能力在高等教育课程中的表现:性能基准测试与基于推理的提示策略

Zhen Xu, Xin Guan, Chenxi Shi, Qinhao Chen, Renzhe Yu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract)

AI总结 本研究利用大语言模型评估21世纪能力在高等教育课程中的表现,提出基于推理的提示策略提升课程分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11881 2026-01-19 cs.LG cs.AI cs.CL 82%

Better LLM Reasoning via Dual-Play

通过双对抗提升大语言模型推理能力

Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PasoDoble通过双对抗训练框架提升大语言模型推理能力,无需外部监督,通过Proposer生成挑战性问题和Solver解决问题,共同训练以增强稳定性与性能。

Comments 33 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22616 2026-01-19 cs.CL cs.AI 81%

PerCoR: Evaluating Commonsense Reasoning in Persian via Multiple-Choice Sentence Completion

PerCoR:通过多项选择句完成评估波斯语的常识推理

Morteza Alikhani, Mohammadtaha Bagherifard, Erfan Zinvandi, Mehran Sarmadi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PerCoR是首个大规模波斯语常识推理基准测试,通过多项选择句完成问题评估常识推理能力,展示了DRESS-AF方法在提升数据集难度和模型性能方面的有效性。

Comments 20 pages, 17 figures, Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11831 2026-01-19 cs.AI 79%

ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems

ARC-AGI-2:前沿人工智能推理系统的全新挑战

Francois Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers, Henry Pinkard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARC-AGI-2通过更细致的任务设计,为评估人工智能的抽象推理和问题解决能力提供更高级的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18344 2026-01-19 cs.AI 77%

LC-LLM: Explainable Lane-Change Intention and Trajectory Predictions with Large Language Models

LC-LLM: 基于大语言模型的可解释车道变更意图与轨迹预测

Mingxing Peng, Xusen Guo, Xianda Chen, Meixin Zhu, Kehua Chen

机构 * Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出LC-LLM模型,利用大语言模型的推理能力,实现车道变更意图和轨迹的可解释预测。

Comments 12 pages, 9 figures

Journal ref Communications in Transportation Research 5 (2025): 100170

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 70%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11468 2026-01-19 cs.AI cs.IT math.IT 57%

Exploring LLM Features in Predictive Process Monitoring for Small-Scale Event-Logs

探索LLM特性在小规模事件日志预测过程监控中的应用

Alessandro Padella, Massimiliano de Leoni, Marlon Dumas

机构 * University of Tartu(塔尔图大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的预测过程监控方法,通过扩展框架评估其通用性、语义利用和推理能力,在小规模事件日志中实现了优于传统方法的预测性能。

Comments 19 pages, 4 figure, TMIS journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC 57%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11039 2026-01-19 cs.SD cs.CL 57%

SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models

SonicBench: 解剖大音频语言模型中的物理感知瓶颈

Yirong Sun, Yanjun Chen, Xin Qiu, Gang Zhang, Hongyu Chen, Daokuan Wu, Chengming Li, Min Yang, Dawei Zhu, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Amazon AGI(亚马逊人工智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SonicBench通过评估大音频语言模型在物理属性感知上的能力,揭示其在基础听觉理解上的不足,指出瓶颈在于对齐和解码阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10131 2026-01-19 cs.AI cs.MA 57%

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

M^4olGen: 多智能体、多阶段分子生成在精确多属性约束下

Yizhan Li, Florence Cloutier, Sifan Wu, Ali Parviz, Boris Knyazev, Yan Zhang, Glen Berseth, Bang Liu

机构 * DIRO & Université de Montréal(DIRO与蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Institut Courtois(Courtois研究所) Samsung AI Lab, Montreal(三星AI实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M^4olGen通过多智能体和强化学习框架,在多属性约束下实现精确分子生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08689 2026-01-19 cs.CL 57%

QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models

QuantEval:大型语言模型中金融量化任务的基准测试

Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin, Kehan Jiang, Zhicheng Fang, Yingjie He, Chunlei Meng, Rong Fu, Dongyang Chen, Leqi Zheng, Eric Hanchen Jiang, Yunfei Feng, Yitong Leng, Junfan Zhu, Xiaoyou Chen, Xi Yang, Richeng Xuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Macau(澳门大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) University of Chicago(芝加哥大学) Shanghai Weina Software Technology(上海韦纳软件技术) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 QuantEval是一个用于评估大型语言模型在金融量化任务中能力的基准测试,涵盖知识问答、数学推理和策略编程,通过回测框架评估模型性能,并展示了改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01386 2026-01-19 cs.LG 57%

ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs

ThinkEval: 基于思维的知识图谱对 LLM 编辑中知识泄漏的实用评估

Manit Baser, Dinil Mon Divakaran, Mohan Gurusamy

机构 * Electrical and Computer Engineering National University of Singapore(新加坡国立大学电子与计算机工程系) A*STAR Institute for Infocomm Research (A*STAR I 2 R), Singapore(新加坡A*STAR信息与通信研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ThinkEval通过构建专门知识图谱评估LLM编辑中的间接知识泄漏,揭示了现有编辑技术在平衡知识抑制与保留方面的不足。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 50%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10909 2026-01-19 cs.CV 50%

FrankenMotion: Part-level Human Motion Generation and Composition

FrankenMotion: 部位级人类动作生成与组合

Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校区)

专题命中 推理评测 :reasoning(abstract)

AI总结 FrankenMotion通过原子性、时间感知的部位级动作标注,实现了对身体部位和原子动作的双重控制,首次在动作生成中引入细粒度部位级标注。

Comments Project page: https://coral79.github.io/frankenmotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06204 2026-01-19 cs.CV cs.MA 50%

Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification

通过视觉-语言模型和基于嵌入的分类实现监视系统中的级联多代理异常检测

Tayyab Rehman, Giovanni De Gasperis, Aly Shmahell

机构 * University of L’Aquila(拉奎拉大学) SPEE S.R.L(SPEE公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种级联多代理框架,结合视觉-语言模型和嵌入分类,实现高效且可解释的异常检测,减少延迟并提升监控系统性能。

Comments Author email changed, Acknowlegement changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01166 2026-01-19 cs.SD 50%

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

听更清晰,用更少:多模态检索与选择增强的对话式LLM基于ASR

Bingshen Mu, Hexin Liu, Hongfei Xue, Kun Wei, Lei Xie

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MARS方法,通过多模态检索与选择提升对话式LLM-ASR的准确性,仅用1.5K小时数据即可超越训练于179K小时数据的顶级系统。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08779 2026-01-19 cs.CV 50%

BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models

BBQ-V:评估大型多模态模型中视觉刻板印象偏见的基准

Vishal Narnaware, Ashmal Vayani, Rohit Gupta, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 BBQ-V通过真实多演员图像和多样类别评估LMMs的刻板印象偏见,揭示了主流模型在推理链中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏