arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-01 至 2025-08-01 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2507.23135 2025-08-01 cs.CL 83%

ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans

Ananya Sadana, Yash Kumar Lal, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23488 2025-08-01 cs.AI 79%

Causal Reasoning in Pieces: Modular In-Context Learning for Causal Discovery

Kacper Kadziolka, Saber Salehkaleybar

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23734 2025-08-01 cs.CV cs.RO 78%

RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping

Dongming Wu, Yanping Fu, Saike Huang, Yingfei Liu, Fan Jia, Nian Liu, Feng Dai, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jianbing Shen

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Dexmal Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SKL-IOTSC, CIS, University of Macau(澳门科学馆-物联网与智能系统研究中心,澳门大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted by ICCV 2025. The code is at https://github.com/wudongming97/AffordanceNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23740 2025-08-01 cs.CL cs.AI cs.LG 75%

Rule2Text: Natural Language Explanation of Logical Rules in Knowledge Graphs

Nasim Shirvani-Mahdavi, Devin Wingfield, Amin Ghasemi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23194 2025-08-01 cs.CL cs.AI cs.LG 67%

Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks

Jianghui Wang, Vinay Joshi, Saptarshi Majumder, Xu Chao, Bin Ding, Ziqiong Liu, Pratik Prabhanjan Brahma, Dong Li, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14939 2025-08-01 cs.CV 67%

VisNumBench: Evaluating Number Sense of Multimodal Large Language Models

Tengjin Weng, Jingyi Wang, Wenhao Jiang, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际 Graduate School) Shenzhen Technology University(深圳技术大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15621 2025-08-01 cs.CV cs.AI cs.CL cs.MM 62%

LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning

Federico Cocchi, Nicholas Moratelli, Davide Caffagni, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) IIT-CNR(意大利国家研究 council(IIT))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ICCV 2025 Workshop on What is Next in Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23429 2025-08-01 cs.AI cs.DB cs.ET cs.HC cs.MA 57%

Chatting with your ERP: A Recipe

Jorge Ruiz Gómez, Lidia Andrés Susinos, Jorge Alamo Olivé, Sonia Rey Osorno, Manuel Luis Gonzalez Hernández

机构 * Instituto Tecnológico de Castilla y León(卡斯蒂利亚-莱昂技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 11 pages, includes 3 tables summarizing schema and model performance. Submitted on July 31, 2025. Targets integration of LLM agents with ERP systems using open-weight models and Ollama deployment

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23377 2025-08-01 cs.AI 57%

LLM4Rail: An LLM-Augmented Railway Service Consulting Platform

Zhuo Li, Xianghuai Deng, Chiwei Feng, Hanmeng Li, Shenjie Wang, Haichao Zhang, Teng Jia, Conlin Chen, Louis Linchun Wu, Jia Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22927 2025-08-01 cs.CL 57%

PRGB Benchmark: A Robust Placeholder-Assisted Algorithm for Benchmarking Retrieval-Augmented Generation

Zhehao Tan, Yihan Jiao, Dan Yang, Lei Liu, Jie Feng, Duolin Sun, Yue Shen, Jian Wang, Peng Wei, Jinjie Gu

机构 * Zhehao Tan(未知) Yihan Jiao(未知) Dan Yang(未知) Lei Liu(未知) Jie Feng(未知) Duolin Sun(未知) Yue Shen(未知) Jian Wang(未知) Peng Wei(未知) Jinjie Gu(未知)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23096 2025-08-01 cs.HC 50%

ChatVis: Large Language Model Agent for Generating Scientific Visualizations

Tom Peterka, Tanwi Mallick, Orcun Yildiz, David Lenz, Cory Quammen, Berk Geveci

专题命中 推理评测 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏