arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-19 至 2025-08-19 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2508.12213 2025-08-19 eess.SP cs.AI cs.LG 62%

Towards Generalizable Human Activity Recognition: A Survey

Yize Cai, Baoshen Guo, Flora Salim, Zhiqing Hong

机构 * Hong Kong University of Science \& Technology (Guangzhou) China SMART, Massachusetts Institute of Technology Singapore University of New South Wales (UNSW) Australia Hong Kong University of Science \& Technology (Guangzhou) SMART, Massachusetts Institute of Technology University of New South Wales (UNSW)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06670 2025-08-19 cs.LG cs.AI 62%

Unveiling the Unseen: A Comprehensive Survey on Explainable Anomaly Detection in Images and Videos

Yizhou Wang, Dongliang Guo, Sheng Li, Octavia Camps, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学) School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学) Department of Electrical and Computer Engineering and Khoury College of Computer Science, Northeastern University(电气与计算机工程系和Khoury计算机科学学院,东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Under review at TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12754 2025-08-19 cs.AI 57%

Beyond Ethical Alignment: Evaluating LLMs as Artificial Moral Assistants

Alessio Galatolo, Luca Alberto Rappuoli, Katie Winkle, Meriem Beloucif

机构 * Uppsala University(乌普萨拉大学) University of St. Andrews(圣安德鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Full version of the paper published in ECAI 2025 proceedings (IOS Press, CC BY-NC 4.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12669 2025-08-19 cs.CL cs.CY 57%

Leveraging Large Language Models for Predictive Analysis of Human Misery

Bishanka Seal, Rahul Seetharaman, Aman Bansal, Abhilash Nandy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12566 2025-08-19 cs.AI 57%

Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models

Wei Song, Haonan Zhong, Ziqi Ding, Jingling Xue, Yuekang Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12472 2025-08-19 cs.AI 57%

GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12282 2025-08-19 cs.CL cs.IR 57%

A Question Answering Dataset for Temporal-Sensitive Retrieval-Augmented Generation

Ziyang Chen, Erxue Min, Xiang Zhao, Yunxin Li, Xin Jia, Jinzhi Liao, Jichao Li, Shuaiqiang Wang, Baotian Hu, Dawei Yin

机构 * Laboratory for Big Data and Decision, National University of Defense Technology, Changsha, China(大数据与决策实验室,国防科技大学,长沙,中国) Baidu Inc., Beijing, China(百度公司,北京,中国) Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), Shenzhen, China(计算机科学与技术系,哈尔滨工业大学(深圳),深圳,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12158 2025-08-19 cs.CL 57%

LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data

Stephen Meisenbacher, Alexandra Klymenko, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 13 pages, 3 figures, 4 tables. Accepted to HAIPS @ CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15125 2025-08-19 cs.AI 57%

Contemplative Artificial Intelligence

Ruben Laukkonen, Fionn Inglis, Shamil Chandaria, Lars Sandved-Smith, Edmundo Lopez-Sola, Jakob Hohwy, Jonathan Gold, Adam Elwood

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24115 2025-08-19 cs.CL cs.MM 57%

TeleAntiFraud-28k: An Audio-Text Slow-Thinking Dataset for Telecom Fraud Detection

Zhiming Ma, Peidong Wang, Minhua Huang, Jingpeng Wang, Kai Wu, Xiangzhao Lv, Yachun Pang, Yin Yang, Wenjie Tang, Yuchen Kang

机构 * China Mobile Internet Company Ltd.(中国移动互联网有限公司) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10872 2025-08-19 cs.CV cs.AI cs.ET 57%

V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?

Natchapon Jongwiriyanurak, Zichao Zeng, June Moh Goo, Xinglei Wang, Ilya Ilyankou, Kerkritt Sriroongvikrai, Nicola Christie, Meihui Wang, Huanfa Chen, James Haworth

机构 * University College London(伦敦大学学院) Chulalongkorn University(朱拉隆梭大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15714 2025-08-19 cs.CL 57%

Chinchunmei at SemEval-2025 Task 11: Boosting the Large Language Model's Capability of Emotion Perception using Contrastive Learning

Tian Li, Yujian Sun, Huizhi Liang

机构 * School of Computing, Newcastle University(计算学院,新卡斯尔大学) Shumei AI Research Institute(舒美人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref Association for Computational Linguistics, Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025), 319-330

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11430 2025-08-19 cs.CL 57%

MHPP: Exploring the Capabilities and Limitations of Language Models Beyond Basic Code Generation

Jianbo Dai, Jianqiao Lu, Yunlong Feng, Guangtao Zeng, Rongju Ruan, Ming Cheng, Dong Huang, Haochen Tan, Zhijiang Guo

机构 * University of Edinburgh(爱丁堡大学) The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Singapore University of Technology and Design(新加坡科技设计大学) South China University of Technology(华南理工大学) City University of Hong Kong(香港城市大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 43 pages, dataset and code are available at https://github.com/SparksofAGI/MHPP, leaderboard can be found at https://sparksofagi.github.io/MHPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10113 2025-08-19 cs.CV 50%

Interpretable Oracle Bone Script Decipherment through Radical and Pictographic Analysis with LVLMs

Kaixin Peng, Mengyang Zhao, Haiyang Yu, Teng Fu, Bin Li

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21610 2025-08-19 cs.RO cs.CV 50%

Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition

Ruiyang Hao, Haibao Yu, Jiaru Zhong, Chuanye Wang, Jiahao Wang, Yiming Kan, Wenxian Yang, Siqi Fan, Huilin Yin, Jianing Qiu, Yao Mu, Jiankai Sun, Li Chen, Walter Zimmer, Dandan Zhang, Shanghang Zhang, Mac Schwager, Ping Luo, Zaiqing Nie

机构 * Tsinghua University(清华大学) Hong Kong University(香港大学) Tongji University(同济大学) Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) OpenDriveLab(OpenDrive实验室) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 推理评测 :planning(abstract)

Comments 10 pages, 4 figures, accepted by ICCVW Author list updated to match the camera-ready version, in compliance with conference policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09693 2025-08-19 cs.CV 50%

ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments

Jiali Chen, Yujie Jia, Zihan Wu, Jinyu Yang, Jianpeng Chen, Xusen Hei, Jiayuan Xie, Yi Cai, Qing Li

机构 * South China University of Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) Key Laboratory of Big Data and Intelligent Robot Ministry of Education(教育部大数据与智能机器人重点实验室)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16867 2025-08-19 cs.CV 50%

ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering

Kaisi Guan, Zhengfeng Lai, Yuchong Sun, Peng Zhang, Wei Liu, Kieran Liu, Meng Cao, Ruihua Song

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract)

Comments International Conference on Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2508.12604 2025-08-19 cs.LG cs.AI 86%

SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression

Yuyang Xu, Yi Cheng, Haochao Ying, Zhuoyun Du, Renjun Hu, Xing Shi, Wei Lin, Jian Wu

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11800 2025-08-19 cs.LG cs.AI 81%

Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes

Michael Bereket, Jure Leskovec

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10265 2025-08-19 cs.AI cs.LO 79%

Why Cannot Large Language Models Ever Make True Correct Reasoning?

Jingde Cheng

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

Comments 8 pages. arXiv admin note: substantial text overlap with arXiv:2412.12408

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17811 2025-08-19 cs.CL cs.AI cs.DB 62%

Feather-SQL: A Lightweight NL2SQL Framework with Dual-Model Collaboration Paradigm for Small Language Models

Wenqi Pei, Hailing Xu, Hengyuan Zhao, Shizheng Hou, Han Chen, Zining Zhang, Pingyi Luo, Bingsheng He

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments DL4C @ ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10824 2025-08-19 cs.LG cs.CL 62%

Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures

Parsa Omidi, Xingshuai Huang, Axel Laborieux, Bahareh Nikpour, Tianyu Shi, Armaghan Eshaghi

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei Technologies Switzerland(华为瑞士技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19595 2025-08-19 cs.LG 57%

Optimizing Language Models for Inference Time Objectives using Reinforcement Learning

Yunhao Tang, Kunhao Zheng, Gabriel Synnaeve, Rémi Munos

机构 * Meta GenAI(Meta 生成式人工智能) Meta FAIR

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

Comments Published as a conference paper at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11823 2025-08-19 cs.CL 57%

Hallucination Detection and Mitigation in Scientific Text Simplification using Ensemble Approaches: DS@GT at CLEF 2025 SimpleText

Krishna Chaitanya Marturi, Heba H. Elwazzan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Text Simplification, hallucination detection, LLMs, CLEF 2025, SimpleText, CEUR-WS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12728 2025-08-19 eess.SP 50%

LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems

Yunsong Huang, Hui-Ming Wang, Qingli Yan, Zhaowei Wang

专题命中 其他推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏