arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2510.13570 2025-10-16 cs.LG 57%

Selective Adversarial Attacks on LLM Benchmarks

Ivan Dubrovsky, Anastasia Orlova, Illarion Iov, Nina Gubina, Irena Gureeva, Alexey Zaytsev

机构 * ITMO University(ITMO大学) Applied AI Institute(应用人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02803 2025-10-16 cs.CL cs.CV 57%

SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking

Sifan Li, Yujun Cai, Yiwei Wang

机构 * University of California, Merced(加州大学默塞德分校) University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20740 2025-10-16 cs.AI 57%

MSEarth: A Multimodal Scientific Dataset and Benchmark for Phenomena Uncovering in Earth Science

Xiangyu Zhao, Wanghan Xu, Bo Liu, Yuhao Zhou, Fenghua Ling, Ben Fei, Xiaoyu Yue, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22337 2025-10-15 cs.CL cs.IR 57%

A Comprehensive Taxonomy of Negation for NLP and Neural Retrievers

Roxana Petcu, Samarth Bhargav, Maarten de Rijke, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00739 2025-10-15 cs.CL 57%

DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments

Chiyu Zhang, Marc-Alexandre Cote, Michael Albada, Anush Sankaran, Jack W. Stokes, Tong Wang, Amir Abdi, William Blum, Muhammad Abdul-Mageed

机构 * Microsoft(微软公司) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025 Workshop Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11631 2025-10-14 cs.CV cs.AI cs.NE 57%

EvoCAD: Evolutionary CAD Code Generation with Vision Language Models

Tobias Preintner, Weixuan Yuan, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * Institute of Advanced Computer Science, Leiden University, Leiden, The Netherlands(先进计算机科学研究所,莱顿大学,莱顿,荷兰)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to IEEE ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11260 2025-10-14 cs.CV cond-mat.mtrl-sci cs.AI physics.data-an 57%

A Large-Language-Model Assisted Automated Scale Bar Detection and Extraction Framework for Scanning Electron Microscopic Images

Yuxuan Chen, Ruotong Yang, Zhengyang Zhang, Mehreen Ahmed, Yanming Wang

机构 * Shanghai Jiao Tong Global College(上海交通大学全球学院) Shanghai Jiao Tong University(上海交通大学) Global Institute of Future Technology(全球未来技术研究院) AI Lab, Xiaomi Corporation(小米公司AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11225 2025-10-14 cs.CL 57%

A Theorem-Proving-Based Evaluation of Neural Semantic Parsing

Hayate Funakura, Hyunsoo Kim, Koji Mineshima

机构 * Kyoto University(京都大学) Keio University(庆应大学) Kikagaku Inc.(麒麟株式会社)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to BlackboxNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10885 2025-10-14 cs.CL cs.DB 57%

Rethinking Agentic Workflows: Evaluating Inference-Based Test-Time Scaling Strategies in Text2SQL Tasks

Jiajing Guo, Kenil Patel, Jorge Piazentin Ono, Wenbin He, Liu Ren

机构 * Bosch Research North America, USA(博世美国研究北美洲) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at COLM 2025 SCALR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09116 2025-10-14 cs.CL 57%

DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation

Enze Zhang, Jiaying Wang, Mengxi Xiao, Jifei Liu, Ziyan Kuang, Rui Dong, Eric Dong, Sophia Ananiadou, Min Peng, Qianqian Xie

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心) Jiangxi Normal University(江西师范大学) The University of Manchester(曼彻斯特大学) Yunnan Trrans Technology Co., Ltd.(云南翻译技术有限公司) Malvern College Chengdu(成都马尔伯学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16700 2025-10-14 cs.AI 57%

MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models

Xuanqi Gao, Siyi Xie, Juan Zhai, Shiqing Ma, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12575 2025-10-14 cs.CR cs.AI 57%

DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent

Pengyu Zhu, Zhenhong Zhou, Yuanhe Zhang, Shilinlu Yan, Kun Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04492 2025-10-14 cs.CL 57%

Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents

Selim Furkan Tekin, Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09684 2025-10-14 cs.LG stat.ME 57%

Using LLMs to Directly Guess Conditional Expectations Can Improve Efficiency in Causal Estimation

Chris Engh, P. M. Aronow

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14028 2025-10-14 cs.CL 57%

MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application

Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09347 2025-10-13 cs.CL 57%

LLP: LLM-based Product Pricing in E-commerce

Hairu Wang, Sheng You, Qiheng Zhang, Xike Xie, Shuguang Han, Yuchen Wu, Fei Huang, Jufeng Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xianyu of Alibaba(阿里巴巴闲鱼)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08928 2025-10-13 cs.AI 57%

LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition

Yushuo Zheng, Zicheng Zhang, Xiongkuo Min, Huiyu Duan, Guangtao Zhai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07740 2025-10-10 cs.SE cs.AI 57%

AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?

Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU)) School of Computer Science, Peking University, China(北京大学计算机科学学院) Columbia University, USA(哥伦比亚大学) Beijing Jiaotong University, China(北京交通大学) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所) Simon Fraser University, Canada(西蒙弗雷泽大学) Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under Review. Benchmark and leadboards at https://appforge-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08111 2025-10-10 cs.CL cs.CY 57%

Evaluating LLM-Generated Legal Explanations for Regulatory Compliance in Social Media Influencer Marketing

Haoyang Gui, Thales Bertaglia, Taylor Annabell, Catalina Goanta, Tjomme Dooper, Gerasimos Spanakis

机构 * Utrecht University(乌特雷赫大学) Stichting Reclame Code(Reclame Code基金会) Maastricht University(马斯特里赫特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07892 2025-10-10 cs.CL 57%

Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models

Hyeonseok Moon, Seongtae Hong, Jaehyung Seo, Heuiseok Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to the EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07861 2025-10-10 cs.AI 57%

Understanding DeepResearch via Reports

Tianyu Fan, Xinyao Niu, Yuxiang Zheng, Fengji Zhang, Chengen Huang, Bei Chen, Junyang Lin, Chao Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07550 2025-10-10 cs.CV cs.AI 57%

TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility

Saman Motamed, Minghao Chen, Luc Van Gool, Iro Laina

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04097 2025-10-10 cs.AI 57%

WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning

Peichao Lai, Jinhui Zhuang, Kexuan Zhang, Ningchang Xiong, Shengjie Wang, Yanwei Xu, Chong Chen, Yilei Wang, Bin Cui

机构 * Peking University(北京大学) Xiamen Huaxia University(厦门华夏大学) Fuzhou University(福州市大学) City University of Hong Kong(香港城市大学) Huawei Cloud BU(华为云业务单元)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01127 2025-10-10 cs.CL 57%

Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench

Ziyi Liu, Priyanka Dey, Jen-tse Huang, Zhenyu Zhao, Bowen Jiang, Rahul Gupta, Yang Liu, Yao Du, Jieyu Zhao

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智慧) John Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01493 2025-10-10 cs.CL 57%

Sherkala-Chat: Building a State-of-the-Art LLM for Kazakh in a Moderately Resourced Setting

Fajri Koto, Rituraj Joshi, Nurdaulet Mukhituly, Yuxia Wang, Zhuohan Xie, Rahul Pal, Daniil Orel, Parvez Mullah, Diana Turmakhan, Maiya Goloburda, Mohammed Kamran, Samujjwal Ghosh, Bokang Jia, Jonibek Mansurov, Mukhammed Togmanov, Debopriyo Banerjee, Nurkhan Laiyk, Akhmed Sakip, Xudong Han, Ekaterina Kochmar, Alham Fikri Aji, Aaryamonvikram Singh, Alok Anil Jadhav, Satheesh Katipomu, Samta Kamboj, Monojit Choudhury, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Biswajit Mishra, Sarath Chandran, Avraham Sheinin, Natalia Vassilieva, Neha Sengupta, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Inception Cerebras Systems(Cerebras系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00096 2025-10-10 q-bio.QM cs.AI 57%

BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology

Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 8 main text pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15081 2025-10-10 cs.NE cs.AI 57%

Can Large Language Models Be Trusted as Evolutionary Optimizers for Network-Structured Combinatorial Problems?

Jie Zhao, Tao Wen, Kang Hao Cheong

机构 * Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University(数学科学系,物理与数学科学学院,南洋理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16185 2025-10-09 cs.CL 57%

ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06426 2025-10-09 cs.CL 57%

FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering

Yitao Long, Tiansheng Hu, Yilun Zhao, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06239 2025-10-09 cs.CL 57%

OpenStaxQA: A multilingual dataset based on open-source college textbooks

Pranav Gupta

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏