arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2509.23395 2025-09-30 cs.CL 57%

Liaozhai through the Looking-Glass: On Paratextual Explicitation of Culture-Bound Terms in Machine Translation

Sherrie Shen, Weixuan Wang, Alexandra Birch

机构 * Institute for Language, Cognition and Computation(语言、认知与计算研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23233 2025-09-30 cs.CL 57%

Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models

Sina J. Semnani, Jirayu Burapacheep, Arpandeep Khatua, Thanawan Atchariyachanvanit, Zheng Wang, Monica S. Lam

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00089 2025-09-30 cs.CY cs.AI 57%

TRAPDOC: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documents

Hyundong Jin, Sicheol Sung, Shinwoo Park, SeungYeop Baik, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21979 2025-09-30 cs.CL 57%

Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset

Fakhraddin Alwajih, Samar M. Magdy, Abdellah El Mekki, Omer Nacar, Youssef Nafea, Safaa Taher Abdelfadil, Abdulfattah Mohammed Yahya, Hamzah Luqman, Nada Almarwani, Samah Aloufi, Baraah Qawasmen, Houdaifa Atou, Serry Sibaee, Hamzah A. Alsayadi, Walid Al-Dhabyani, Maged S. Al-shaibani, Aya El Aatar, Nour Qandos, Rahaf Alhamouri, Samar Ahmad, Mohammed Anwar Al-Ghrawi, Aminetou Yacoub, Ruwa AbuHweidi, Vatimetou Mohamed Lemin, Reem Abdel-Salam, Ahlam Bashiti, Aisha Alansari, Ahmed Ashraf, Nora Alturayeif, Alcides Alcoba Inciarte, Adel Ammar, Abdelrahim A. Elmadany, Mohamedou Cheikh Tourad, Ismail Berrada, Mustafa Jarrar, Shady Shehata, Muhammad Abdul-Mageed

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments https://github.com/UBC-NLP/pearl

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 57%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22391 2025-09-29 cs.AI 57%

Do LLM Agents Know How to Ground, Recover, and Assess? A Benchmark for Epistemic Competence in Information-Seeking Agents

Jiaqi Shao, Yuxiang Lin, Munish Prasad Lohani, Yufeng Miao, Bing Luo

机构 * Duke Kunshan University(杜克昆山大学) Microsoft AI(微软人工智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21949 2025-09-29 cs.NI cs.CL 57%

Evaluating Open-Source Large Language Models for Technical Telecom Question Answering

Arina Caraus, Alessio Buscemi, Sumit Kumar, Ion Turcanu

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究院) RMT Labs(RMT实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at the IEEE GLOBECOM Workshops 2025: "Large AI Model over Future Wireless Networks"

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09498 2025-09-29 cs.AI 57%

SEDM: Scalable Self-Evolving Distributed Memory for Agents

Haoran Xu, Jiacong Hu, Ke Zhang, Lei Yu, Yuxin Tang, Xinyuan Song, Yiqun Duan, Lynn Ai, Bill Shi

机构 * Gradient Zhejiang University(Gradient浙江大学) Gradient South China University of Technology(Gradient南方科技大学) Gradient Waseda University(Gradient武藏大学) Gradient University of Toronto(Gradient多伦多大学) Gradient Rice University(Gradient里士满大学) Gradient Emory University(Gradient埃默里大学) Gradient University of Technology Sydney(Gradient悉尼技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21556 2025-09-29 cs.CL 57%

VAT-KG: Knowledge-Intensive Multimodal Knowledge Graph Dataset for Retrieval-Augmented Generation

Hyeongcheol Park, Jiyoung Seo, MinHyuk Jang, Hogun Park, Ha Dam Baek, Gyusam Chang, Hyeonsoo Im, Sangpil Kim

机构 * Korea University(韩国大学) Sungkyunkwan University(全北大学) Hanwha Systems(韩华系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Project Page: https://vatkg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15197 2025-09-29 cs.CV cs.AI cs.GR 57%

Intentional Gesture: Deliver Your Intentions with Gestures for Speech

Pinxin Liu, Haiyang Liu, Luchuan Song, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12881 2025-09-29 cs.CL 57%

TEXT2AFFORD: Probing Object Affordance Prediction abilities of Language Models solely from Text

Sayantan Adak, Daivik Agrawal, Animesh Mukherjee, Somak Aditya

机构 * IIT, Kharagpur(印度Kharagpur理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at Conference on Computational Natural Language Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21144 2025-09-26 cs.SD cs.AI 57%

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

Sitong Cheng, Weizhen Bian, Xinsheng Wang, Ruibin Yuan, Jianyi Chen, Shunshun Yin, Yike Guo, Wei Xue

机构 * Hong Kong University of Science and Technology(香港理工大学) Soul AI Lab(Soul AI 实验室)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20769 2025-09-26 cs.IR cs.AI cs.CV 57%

Provenance Analysis of Archaeological Artifacts via Multimodal RAG Systems

Tuo Zhang, Yuechun Sun, Ruiliang Liu

机构 * Museus University of Science and Technology of China(中国科学技术大学) British Museum(大英博物馆)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19926 2025-09-25 cs.LG 57%

MMSE-Calibrated Few-Shot Prompting for Alzheimer's Detection

Jana Sweidan, Mounim A. El-Yacoubi, Nasredine Semmar

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18813 2025-09-25 cs.CL 57%

MAPEX: A Multi-Agent Pipeline for Keyphrase Extraction

Liting Zhang, Shiwan Zhao, Aobo Kong, Qicheng Li

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(天津大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18993 2025-09-25 cs.CL cs.DB 57%

MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering

Teng Lin, Yuyu Luo, Honglin Zhang, Jicheng Zhang, Chunlin Liu, Kaishun Wu, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Mobile Information Technology Company Limited(中国移动信息技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18400 2025-09-24 cs.AI 57%

ATLAS: Benchmarking and Adapting LLMs for Global Trade via Harmonized Tariff Code Classification

Pritish Yuvraj, Siva Devarakonda

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Journal ref Paper in Review For ICLR 2026 (Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18226 2025-09-24 cs.AI 57%

From "What to Eat?" to Perfect Recipe: ChefMind's Chain-of-Exploration for Ambiguous User Intent in Recipe Recommendation

Yu Fu, Linyue Cai, Ruoyu Wu, Yong Zhao

机构 * Sichuan University Department of Computer Science Shuangliu District, Chengdu City, Sichuan Province, China(四川大学计算机学院双流区,成都市,四川省,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 5 pages, 3 figures, submitted to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18154 2025-09-24 cs.LG cs.CV 57%

MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe

Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Yuanqian Zhao, Bokai Xu, Junbo Cui, Yingjing Xu, Liqing Ruan, Luoyuan Zhang, Hanyu Liu, Jingkun Tang, Hongyuan Liu, Qining Guo, Wenhao Hu, Bingxiang He, Jie Zhou, Jie Cai, Ji Qi, Zonghao Guo, Chi Chen, Guoyang Zeng, Yuxuan Li, Ganqu Cui, Ning Ding, Xu Han, Yuan Yao, Zhiyuan Liu, Maosong Sun

机构 * MiniCPM-V Team, OpenBMB(MiniCPM-V团队,OpenBMB)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Project Website: https://github.com/OpenBMB/MiniCPM-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11101 2025-09-24 cs.CL 57%

Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学工业技术研究所) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments I need to modify the content of the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19813 2025-09-24 cs.CL 57%

T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables

Jie Zhang, Changzai Pan, Kaiwen Wei, Sishi Xiong, Yu Zhao, Xiangyu Li, Jiaxin Peng, Xiaoyan Gu, Jian Yang, Wenhan Chang, Zhenhe Wu, Jiang Zhong, Shuangyong Song, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11405 2025-09-23 cs.CL 57%

DCR: Quantifying Data Contamination in LLMs Evaluation

Cheng Xu, Nan Yan, Shuhao Guan, Changhong Jin, Yuke Mei, Yibing Guo, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16722 2025-09-23 cs.CL 57%

A Multi-Level Benchmark for Causal Language Understanding in Social Media Discourse

Xiaohan Ding, Kaike Ping, Buse Çarık, Eugenia Rho

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16720 2025-09-23 cs.CL 57%

Time to Revist Exact Match

Auss Abbood, Zaiqiao Meng, Nigel Collier

机构 * Language Technology Lab University of Cambridge(语言技术实验室剑桥大学) School of Computing Science University of Glasgow(计算科学学院格拉斯哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16686 2025-09-23 cs.CL 57%

EG-MLA: Embedding-Gated Multi-head Latent Attention for Scalable and Efficient LLMs

Zhengge Cai, Haowen Hou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16679 2025-09-23 cs.CL 57%

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle

Keliang Liu, Dingkang Yang, Ziyun Qian, Weijie Yin, Yuchi Wang, Hongsheng Li, Jun Liu, Peng Zhai, Yang Liu, Lihua Zhang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) Lancaster University(兰卡斯特大学) Tongji University(同济大学) The University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments A Survey of Reinforcement Learning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16610 2025-09-23 cs.CL 57%

LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts

Junhao Chen, Jingbo Sun, Xiang Li, Haidong Xin, Yuhao Xue, Yibin Xu, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Tongji University(同济大学) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18831 2025-09-23 cs.CL 57%

Measuring Risk of Bias in Biomedical Reports: The RoBBR Benchmark

Jianyou Wang, Weili Cao, Longtian Bao, Youze Zheng, Gil Pasternak, Kaicheng Wang, Xiaoyue Wang, Ramamohan Paturi, Leon Bergen

机构 * Laboratory for Emerging Intelligence(新兴智能实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16107 2025-09-22 cs.CL 57%

It Depends: Resolving Referential Ambiguity in Minimal Contexts with Commonsense Knowledge

Lukas Ellinger, Georg Groh

机构 * School for Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by UncertaiNLP workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11103 2025-09-22 cs.CV cs.AI 57%

Pruning the Paradox: How CLIP's Most Informative Heads Enhance Performance While Amplifying Bias

Avinash Madasu, Vasudev Lal, Phillip Howard

机构 * Intel Labs(英特尔实验室) Oracle(Oracle公司) Thoughtworks(Thoughtworks公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏