arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-13 至 2025-08-13 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2504.00043 2025-08-13 cs.CL cs.AI cs.CV 81%

CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation

Jixuan Leng, Chengsong Huang, Langlin Huang, Bill Yuchen Lin, William W. Cohen, Haohan Wang, Jiaxin Huang

机构 * CMU(卡内基梅隆大学) WUSTL(华盛顿大学) UIUC(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08926 2025-08-13 cs.AI 79%

Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models

Wei Cai, Jian Zhao, Yuchu Jiang, Tianle Zhang, Xuelong Li

机构 * Peking University(北京大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Southeast University(东南大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14805 2025-08-13 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?

Yang Yao, Lingyu Li, Jiaxin Song, Chiyu Chen, Zhenqi He, Yixu Wang, Xin Wang, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04903 2025-08-13 cs.CL cs.AI cs.MA 62%

RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory

Jun Liu, Zhenglun Kong, Changdi Yang, Fan Yang, Tianqi Li, Peiyan Dong, Joannah Nanjekye, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue Lin, Dong Huang, Yanzhi Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20252 2025-08-13 cs.CL cs.AI 62%

Post-Completion Learning for Language Models

Xiang Fei, Siqi Wang, Shu Wei, Yuxiang Nie, Wei Shi, Hao Feng, Chao Feng, Can Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07114 2025-08-13 cs.CL cs.AI cs.CY cs.HC 62%

ChatBench: From Static Benchmarks to Human-AI Evaluation

Serina Chang, Ashton Anderson, Jake M. Hofman

机构 * Microsoft Research(微软研究院) University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18043 2025-08-13 cs.CL cs.IR cs.LG 62%

Utilizing Large Language Models for Information Extraction from Real Estate Transactions

Yu Zhao, Haoxiang Gao, Jinghan Cao, Shiqi Yang

机构 * Rotman School of Management University of Toronto(罗特曼管理学院 东京大学) ECE Department Carnegie Mellon University(电子工程系 卡内基梅隆大学) Department of Computer Science San Francisco State University(计算机科学系 旧金山州立大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08287 2025-08-13 cs.CL cs.AI cs.CY 62%

Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions

Farah Atif, Nursultan Askarbekuly, Kareem Darwish, Monojit Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08632 2025-08-13 cs.AI 57%

AgriGPT: a Large Language Model Ecosystem for Agriculture

Bo Yang, Yu Zhang, Lanfei Feng, Yunkui Chen, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Yurui Li, Yuxuan Chen, Guijun Yang, Yong He, Runhe Huang, Shijian Li

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) College of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Geological Engineering and Geomatics, Chang’an University, China(长安大学地质工程与测绘学院) College of Biosystems Engineering and Food Science, Zhejiang University, China(浙江大学生物系统工程与食品科学学院) Faculty of Computer and Information Sciences, Hosei University, Japan(立命馆大学计算机与信息科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08308 2025-08-13 cs.AI 57%

First Ask Then Answer: A Framework Design for AI Dialogue Based on Supplementary Questioning with Large Language Models

Chuanruo Fu, Yuncheng Du

机构 * Beijing Information Science and Technology University(北京信息科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2508.08386 2025-08-13 cs.CL 85%

CoDAE: Adapting Large Language Models for Education via Chain-of-Thought Data Augmentation

Shuzhou Yuan, William LaCroix, Hardik Ghoshal, Ercong Nie, Michael Färber

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21425 2025-08-13 cs.SE 85%

GUARD:Dual-Agent based Backdoor Defense on Chain-of-Thought in Neural Code Generation

Naizhu Jin, Zhong Li, Tian Zhang, Qingkai Zeng

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

Comments Accepted by SEKE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08657 2025-08-13 cs.LG cs.AI cs.CL 67%

$\text{M}^{2}$LLM: Multi-view Molecular Representation Learning with Large Language Models

Jiaxin Ju, Yizhen Zheng, Huan Yee Koh, Can Wang, Shirui Pan

机构 * School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院) Department of Data Science and AI, Monash University(莫纳什大学数据科学与人工智能系) Drug Discovery Biology, Monash Institute of Pharmaceutical Sciences, Monash University(莫纳什大学药学科学研究所药物发现生物学部)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06671 2025-08-13 cs.CL cs.AI 62%

Do Biased Models Have Biased Thoughts?

Swati Rajwal, Shivank Garg, Reem Abdel-Salam, Abdelrahman Zayed

机构 * Emory University(埃默里大学) Indian Institute of Technology Roorkee(印度理工学院罗里克分校) Cairo University(开罗大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) Amazon(亚马逊)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at main track of the Second Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04276 2025-08-13 cs.CL cs.AI 62%

A Few Words Can Distort Graphs: Knowledge Poisoning Attacks on Graph-based Retrieval-Augmented Generation of Large Language Models

Jiayi Wen, Tianxin Chen, Zhirun Zheng, Cheng Huang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10648 2025-08-13 cs.LG stat.ML 57%

LLM-Lasso: A Robust Framework for Domain-Informed Feature Selection and Regularization

Erica Zhang, Ryunosuke Goto, Naomi Sagan, Jurik Mutter, Nick Phillips, Ash Alizadeh, Kangwook Lee, Jose Blanchet, Mert Pilanci, Robert Tibshirani

机构 * Stanford University School of Engineering(斯坦福大学工程学院) Stanford University School of Medicine(斯坦福大学医学院) Stanford University Department of Statistics(斯坦福大学统计学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00324 2025-08-13 cs.AI 57%

Vision Language Models See What You Want but not What You See

Qingying Gao, Yijiang Li, Haiyun Lyu, Haoran Sun, Dezhi Luo, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) University of California San Diego(加州大学圣地亚哥分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10066 2025-08-13 cs.MM cs.CV 50%

LayLens: Improving Deepfake Understanding through Simplified Explanations

Abhijeet Narang, Parul Gupta, Liuyijia Su, Abhinav Dhall

机构 * Monash University(墨尔本大学)

专题命中 其他推理 :reasoning(abstract)

Comments Accepted to ACM ICMI 2025 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏