arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-10 至 2025-10-10 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 25 篇

2507.16746 2025-10-10 cs.CV cs.CL cs.LG 90%

Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning

Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, Tom Goldstein, Micah Goldblum

机构 * Columbia University(哥伦比亚大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);planning(abstract);分类 cs.CL、cs.LG

Comments dataset link: https://huggingface.co/datasets/multimodal-reasoning-lab/Zebra-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09513 2025-10-10 cs.CL cs.AI cs.MA 86%

ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning

Yu Sun, Xingyu Qian, Weiwen Xu, Hao Zhang, Chenghao Xiao, Long Li, Deli Zhao, Wenbing Huang, Tingyang Xu, Qifeng Bai, Yu Rong

机构 * Alibaba DAMO Academy(阿里巴巴达摩院) School of Basic Medical Sciences, Lanzhou University(兰州大学基础医学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08559 2025-10-10 cs.CV cs.AI 83%

SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models

Andong Deng, Taojiannan Yang, Shoubin Yu, Lincoln Spencer, Mohit Bansal, Chen Chen, Serena Yeung-Levy, Xiaohan Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00529 2025-10-10 cs.CL cs.CY 79%

Modeling Motivated Reasoning in Law: Evaluating Strategic Role Conditioning in LLM Summarization

Eunjung Cho, Alexander Hoyle, Yoan Hermstrüwer

机构 * ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Max Planck Institute for Research on Collective Goods(集体利益研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at NLLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08481 2025-10-10 cs.SI 78%

Forecasting the Buzz: Enriching Hashtag Popularity Prediction with LLM Reasoning

Yifei Xu, Jiaying Wu, Herun Wan, Yang Li, Zhen Hou, Min-Yen Kan

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted to CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09736 2025-10-10 cs.CV 78%

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

Lin Long, Yichen He, Wentao Ye, Yiyuan Pan, Yuan Lin, Hang Li, Junbo Zhao, Wei Li

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07489 2025-10-10 cs.AI cs.CL cs.CY cs.IR cs.LG 69%

Evaluation of LLMs for Process Model Analysis and Optimization

Akhil Kumar, Jianliang Leon Zhao, Om Dobariya

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 67%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08022 2025-10-10 cs.LG cs.AI cs.CL cs.CV 67%

Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining

Chenxi Liu, Tianyi Xiong, Yanshuo Chen, Ruibo Chen, Yihan Wu, Junfeng Guo, Tianyi Zhou, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 67%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07912 2025-10-10 cs.CL cs.AI 62%

Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation

Fanwei Zhua, Jiaxuan He, Xiaoxiao Chen, Zulong Chen, Quan Lu, Chenrui Mei

机构 * Hangzhou City University(杭州市大学) Alibaba Group(阿里巴巴集团) Zhejiang Hospital(浙江省医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07709 2025-10-10 cs.AI cs.CL cs.CY cs.MA 62%

Multimodal Safety Evaluation in Generative Agent Social Simulations

Alhim Vera, Karen Sanchez, Carlos Hinojosa, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem

机构 * University of Cincinnati(辛辛那提大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07356 2025-10-10 cs.LG cs.CL cs.CV stat.ML 62%

ConCuR: Conciseness Makes State-of-the-Art Kernel Generation

Lingcheng Kong, Jiateng Wei, Hanzhang Shen, Huan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07740 2025-10-10 cs.SE cs.AI 57%

AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?

Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU)) School of Computer Science, Peking University, China(北京大学计算机科学学院) Columbia University, USA(哥伦比亚大学) Beijing Jiaotong University, China(北京交通大学) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所) Simon Fraser University, Canada(西蒙弗雷泽大学) Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under Review. Benchmark and leadboards at https://appforge-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08111 2025-10-10 cs.CL cs.CY 57%

Evaluating LLM-Generated Legal Explanations for Regulatory Compliance in Social Media Influencer Marketing

Haoyang Gui, Thales Bertaglia, Taylor Annabell, Catalina Goanta, Tjomme Dooper, Gerasimos Spanakis

机构 * Utrecht University(乌特雷赫大学) Stichting Reclame Code(Reclame Code基金会) Maastricht University(马斯特里赫特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07892 2025-10-10 cs.CL 57%

Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models

Hyeonseok Moon, Seongtae Hong, Jaehyung Seo, Heuiseok Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to the EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07861 2025-10-10 cs.AI 57%

Understanding DeepResearch via Reports

Tianyu Fan, Xinyao Niu, Yuxiang Zheng, Fengji Zhang, Chengen Huang, Bei Chen, Junyang Lin, Chao Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07550 2025-10-10 cs.CV cs.AI 57%

TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility

Saman Motamed, Minghao Chen, Luc Van Gool, Iro Laina

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04097 2025-10-10 cs.AI 57%

WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning

Peichao Lai, Jinhui Zhuang, Kexuan Zhang, Ningchang Xiong, Shengjie Wang, Yanwei Xu, Chong Chen, Yilei Wang, Bin Cui

机构 * Peking University(北京大学) Xiamen Huaxia University(厦门华夏大学) Fuzhou University(福州市大学) City University of Hong Kong(香港城市大学) Huawei Cloud BU(华为云业务单元)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01127 2025-10-10 cs.CL 57%

Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench

Ziyi Liu, Priyanka Dey, Jen-tse Huang, Zhenyu Zhao, Bowen Jiang, Rahul Gupta, Yang Liu, Yao Du, Jieyu Zhao

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智慧) John Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01493 2025-10-10 cs.CL 57%

Sherkala-Chat: Building a State-of-the-Art LLM for Kazakh in a Moderately Resourced Setting

Fajri Koto, Rituraj Joshi, Nurdaulet Mukhituly, Yuxia Wang, Zhuohan Xie, Rahul Pal, Daniil Orel, Parvez Mullah, Diana Turmakhan, Maiya Goloburda, Mohammed Kamran, Samujjwal Ghosh, Bokang Jia, Jonibek Mansurov, Mukhammed Togmanov, Debopriyo Banerjee, Nurkhan Laiyk, Akhmed Sakip, Xudong Han, Ekaterina Kochmar, Alham Fikri Aji, Aaryamonvikram Singh, Alok Anil Jadhav, Satheesh Katipomu, Samta Kamboj, Monojit Choudhury, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Biswajit Mishra, Sarath Chandran, Avraham Sheinin, Natalia Vassilieva, Neha Sengupta, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Inception Cerebras Systems(Cerebras系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00096 2025-10-10 q-bio.QM cs.AI 57%

BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology

Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 8 main text pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15081 2025-10-10 cs.NE cs.AI 57%

Can Large Language Models Be Trusted as Evolutionary Optimizers for Network-Structured Combinatorial Problems?

Jie Zhao, Tao Wen, Kang Hao Cheong

机构 * Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University(数学科学系,物理与数学科学学院,南洋理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08508 2025-10-10 cs.CV 50%

MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration

Lu Liu, Chunlei Cai, Shaocheng Shen, Jianfeng Liang, Weimin Ouyang, Tianxiao Ye, Jian Mao, Huiyu Duan, Jiangchao Yao, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Bilibili Inc.(哔哩哔哩公司)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15130 2025-10-10 cs.CV 50%

TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba

Xiuwei Chen, Wentao Hu, Xiao Dong, Sihao Lin, Zisheng Chen, Meng Cao, Yina Zhuang, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong Polytechnic University(香港理工大学) Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区) University of Adelaide(阿德莱德大学) Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏