arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2506.01305 2025-06-16 cs.CL 57%

VM14K: First Vietnamese Medical Benchmark

Thong Nguyen, Duc Nguyen, Minh Dang, Thai Dao, Long Nguyen, Quan H. Nguyen, Dat Nguyen, Kien Tran, Minh Tran

机构 * Vietnam National University(越南国家大学) Dickinson College(迪金森学院) Columbia University(哥伦比亚大学) Venera AI Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) Foreign Trade University(外贸大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02050 2025-06-16 cs.CL 57%

JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models

Hitomi Yanaka, Namgi Han, Ryoma Kumon, Jie Lu, Masashi Takeshita, Ryo Sekizawa, Taisei Kato, Hiromi Arai

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Hokkaido University(北海道大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted to the 6th Workshop on Gender Bias in Natural Language Processing (GeBNLP2025) at ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10415 2025-06-13 cs.CL cs.CV 57%

Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?

Yingjin Song, Yupei Du, Denis Paperno, Albert Gatt

机构 * Utrecht University(乌特雷赫大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 27 pages, 14 figures. Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10389 2025-06-13 cs.LG 57%

EQA-RM: A Generative Embodied Reward Model with Test-time Scaling

Yuhang Chen, Zhen Tan, Tianlong Chen

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10384 2025-06-13 cs.AI 57%

NeuroPAL: Punctuated Anytime Learning with Neuroevolution for Macromanagement in Starcraft: Brood War

Jim O'Connor, Yeonghun Lee, Gary B Parker

机构 * Computer Science Department(计算机科学系) Connecticut College(康涅狄格学院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments IEEE Conference on Games 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10282 2025-06-13 cs.LG 57%

Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning

Jiajin Liu, Dongzhe Fan, Jiacheng Shen, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * New York University Shanghai(纽约大学上海校区) University of Chinese Academy of Sciences(中国科学院大学) Rice University(德克萨斯大学里德学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19726 2025-06-13 cs.AI 57%

Position: Theory of Mind Benchmarks are Broken for Large Language Models

Matthew Riemer, Zahra Ashktorab, Djallel Bouneffouf, Payel Das, Miao Liu, Justin D. Weisz, Murray Campbell

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07130 2025-06-13 cs.CL 57%

On Many-Shot In-Context Learning for Long-Context Evaluation

Kaijian Zou, Muhammad Khalifa, Lu Wang

机构 * Computer Science and Engineering, University of Michigan(计算机科学与工程系,密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01796 2025-06-13 cs.AI cs.HC cs.RO 57%

Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge

Weihua Du, Qiushi Lyu, Jiaming Shan, Zhenting Qi, Hongxin Zhang, Sunli Chen, Andi Peng, Tianmin Shu, Kwonjoon Lee, Behzad Dariush, Chuang Gan

机构 * Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Harvard University(哈佛大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) MIT(麻省理工学院) Johns Hopkins University(约翰霍普金斯大学) Honda Research Institute USA(本田美国研究院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments NeurIPS 2024 Dataset and Benchmark Track. The first two authors contributed equally. Project Website at https://umass-embodied-agi.github.io/CHAIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07321 2025-06-13 cs.CL 57%

Benchmarking LLMs for Environmental Review and Permitting

Rounak Meyur, Hung Phan, Koby Hayashi, Ian Stewart, Shivam Sharma, Sarthak Chaturvedi, Mike Parker, Dan Nally, Sadie Montgomery, Karl Pazdernik, Ali Jannesari, Mahantesh Halappanavar, Sai Munikoti, Sameera Horawalavithana, Anurag Acharya

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Iowa State University(爱荷华州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09987 2025-06-12 cs.CV cs.LG 57%

A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs

Benno Krojer, Mojtaba Komeili, Candace Ross, Quentin Garrido, Koustuv Sinha, Nicolas Ballas, Mahmoud Assran

机构 * FAIR at Meta(Meta旗下的FAIR) McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21025 2025-06-12 cs.CL 57%

Durghotona GPT: A Web Scraping and Large Language Model Based Framework to Generate Road Accident Dataset Automatically in Bangladesh

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain, Md. Ridwanul Islam

专题命中 推理评测 :planning(abstract);分类 cs.CL

Comments It has been accepted in IEEE 27th International Conference on Computer and Information Technology (ICCIT). Now, we are waiting for it to get published in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09329 2025-06-12 cs.CL 57%

Towards Efficient and Effective Alignment of Large Language Models

Yuxin Jiang

机构 * Division of Emerging Interdisciplinary Areas(新兴跨学科领域 division)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08422 2025-06-12 cs.AI 57%

Transforming Expert Knowledge into Scalable Ontology via Large Language Models

Ikkei Itoku, David Theil, Evelyn Eichelsdoerfer Uehara, Sreyoshi Bhaduri, Junnosuke Kuroda, Toshi Yumoto, Alex Gil, Natalie Perez, Rajesh Cherukuri, Naumaan Nayyar

机构 * Amazon New York, USA(亚马逊纽约分公司) Amazon Arlington, USA(亚马逊阿灵顿分公司) Amazon Seattle, USA(亚马逊西雅图分公司) Amazon Honolulu, USA(亚马逊檀香山分公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20421 2025-06-12 cs.AI 57%

Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA

Qianqi Yan, Xuehai He, Xiang Yue, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12803 2025-06-12 cs.CV cs.LG 57%

TextSquare: Scaling up Text-Centric Visual Instruction Tuning

Jingqun Tang, Chunhui Lin, Zhen Zhao, Shu Wei, Binghong Wu, Qi Liu, Yangfan He, Kuan Lu, Hao Feng, Yang Li, Siqi Wang, Lei Liao, Wei Shi, Yuliang Liu, Hao Liu, Yuan Xie, Xiang Bai, Can Huang

机构 * ByteDance Inc.(字节跳动公司) East China Normal University(东华大学) Huazhong University of Science and Technology(华中科技大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08486 2025-06-11 cs.AI 57%

RHealthTwin: Towards Responsible and Multimodal Digital Twins for Personalized Well-being

Rahatara Ferdousi, M Anwar Hossain

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 18 pages, 12 figures, IEEE EMBS JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13949 2025-06-11 cs.CL cs.CV 57%

Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence

Jinghan He, Kuan Zhu, Haiyun Guo, Junfeng Fang, Zhenglin Hua, Yuheng Jia, Ming Tang, Tat-Seng Chua, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Southeast University(东南大学) Wuhan AI Research(武汉人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14669 2025-06-11 cs.CV cs.CL 57%

NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples

Baiqi Li, Zhiqiu Lin, Wenxuan Peng, Jean de Dieu Nyandwi, Daniel Jiang, Zixian Ma, Simran Khanuja, Ranjay Krishna, Graham Neubig, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NeurIPS 24; We open-source our dataset at: https://huggingface.co/datasets/BaiqiL/NaturalBench ; Project page at: https://linzhiqiu.github.io/papers/naturalbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07418 2025-06-10 cs.AI 57%

Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests

Arnau Igualde Sáez, Lamyae Rhomrasi, Yusef Ahsini, Ricardo Vinuesa, Sergio Hoyas, Jose P. García Sabater, Marius J. Fullana i Alfonso, J. Alberto Conejero

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07247 2025-06-10 cs.LG 57%

Promoting Ensemble Diversity with Interactive Bayesian Distributional Robustness for Fine-tuning Foundation Models

Ngoc-Quan Pham, Tuan Truong, Quyen Tran, Tan Nguyen, Dinh Phung, Trung Le

机构 * Qualcomm AI Research, Qualcomm Vietnam Company Limited(高通人工智能研究, 高通越南公司) National University of Singapore, Singapore(新加坡国立大学) Monash University, Australia(墨尔本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments ICML 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07227 2025-06-10 cs.CV cs.CL 57%

Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning

Tianyi Bai, Yuxuan Fan, Jiantao Qiu, Fupeng Sun, Jiayi Song, Junlin Han, Zichen Liu, Conghui He, Wentao Zhang, Binhang Yuan

机构 * HKUST(香港科技大学) Shanghai AI Lab(上海人工智能实验室) Peking University(北京大学) HKUST(GZ)(香港科技大学(广州)) Oxford University(牛津大学) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07116 2025-06-10 cs.AI 57%

BRIGHT+: Upgrading the BRIGHT Benchmark with MARCUS, a Multi-Agent RAG Clean-Up Suite

Liyang Chen, Yujun Cai, Jieqiong Dong, Yiwei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) Central South University(中央南大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 7 figures, 4 tables. Submitted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17663 2025-06-10 cs.CL cs.CY 57%

Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human States

Yang Xiao, Jiashuo Wang, Qiancheng Xu, Changhe Song, Chunpu Xu, Yi Cheng, Wenjie Li, Pengfei Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14996 2025-06-10 cs.CL 57%

Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering

Francesco Maria Molfese, Luca Moroni, Luca Gioffré, Alessandro Scirè, Simone Conia, Roberto Navigli

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Babelscape

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Findings of the Association for Computational Linguistics ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10903 2025-06-10 cs.CL cs.HC 57%

BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language Model

Yeyong Yu, Runsheng Yu, Haojie Wei, Zhanqiu Zhang, Quan Qian

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06950 2025-06-10 cs.CL 57%

What Makes a Good Natural Language Prompt?

Do Xuan Long, Duy Dinh, Ngoc-Hai Nguyen, Kenji Kawaguchi, Nancy F. Chen, Shafiq Joty, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Salesforce AI Research(Salesforce人工智能研究) Institute for Infocomm Research (I 2 R), A*STAR(信息与通信研究 institute(I2R),A*STAR)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06636 2025-06-10 cs.CL 57%

SafeLawBench: Towards Safe Alignment of Large Language Models

Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun, Zhenghao Zhu, Yinyu Wu, Juntao Dai, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12693 2025-06-10 cs.CV cs.AI 57%

SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation

Wenyu Zhang, Wei En Ng, Lixin Ma, Yuwen Wang, Junqi Zhao, Allison Koenecke, Boyang Li, Lu Wang

机构 * National University of Singapore (NUS)(新加坡国立大学) Nanyang Technological University (NTU)(南洋理工大学) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06242 2025-06-09 cs.CV cs.AI 57%

Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models

Zahra Babaiee, Peyman M. Kiasari, Daniela Rus, Radu Grosu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏