arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-30 至 2025-09-30 共收录 190 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 48 篇

2504.04740 2025-09-30 cs.CV cs.AI 57%

SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data

Samarth Mishra, Kate Saenko, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23827 2025-09-30 cs.CV cs.LG 57%

Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23395 2025-09-30 cs.CL 57%

Liaozhai through the Looking-Glass: On Paratextual Explicitation of Culture-Bound Terms in Machine Translation

Sherrie Shen, Weixuan Wang, Alexandra Birch

机构 * Institute for Language, Cognition and Computation(语言、认知与计算研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23233 2025-09-30 cs.CL 57%

Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models

Sina J. Semnani, Jirayu Burapacheep, Arpandeep Khatua, Thanawan Atchariyachanvanit, Zheng Wang, Monica S. Lam

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00089 2025-09-30 cs.CY cs.AI 57%

TRAPDOC: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documents

Hyundong Jin, Sicheol Sung, Shinwoo Park, SeungYeop Baik, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21979 2025-09-30 cs.CL 57%

Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset

Fakhraddin Alwajih, Samar M. Magdy, Abdellah El Mekki, Omer Nacar, Youssef Nafea, Safaa Taher Abdelfadil, Abdulfattah Mohammed Yahya, Hamzah Luqman, Nada Almarwani, Samah Aloufi, Baraah Qawasmen, Houdaifa Atou, Serry Sibaee, Hamzah A. Alsayadi, Walid Al-Dhabyani, Maged S. Al-shaibani, Aya El Aatar, Nour Qandos, Rahaf Alhamouri, Samar Ahmad, Mohammed Anwar Al-Ghrawi, Aminetou Yacoub, Ruwa AbuHweidi, Vatimetou Mohamed Lemin, Reem Abdel-Salam, Ahlam Bashiti, Aisha Alansari, Ahmed Ashraf, Nora Alturayeif, Alcides Alcoba Inciarte, Adel Ammar, Abdelrahim A. Elmadany, Mohamedou Cheikh Tourad, Ismail Berrada, Mustafa Jarrar, Shady Shehata, Muhammad Abdul-Mageed

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments https://github.com/UBC-NLP/pearl

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24898 2025-09-30 cs.CV 50%

Accurate Cobb Angle Estimation via SVD-Based Curve Detection and Vertebral Wedging Quantification

Chang Shi, Nan Meng, Yipeng Zhuang, Moxin Zhao, Jason Pui Yin Cheung, Hua Huang, Xiuyuan Chen, Cong Nie, Wenting Zhong, Guiqiang Jiang, Yuxin Wei, Jacob Hong Man Yu, Si Chen, Xiaowen Ou, Teng Zhang

机构 * Department of Orthopaedics and Traumatology, LKS Faculty of Medicine, The University of Hong Kong(骨科与创伤学系,李嘉诚医学院,香港大学) Department of Spine Surgery, Renji Hospital, School of Medicine, Shanghai Jiao Tong University(脊柱外科科,仁济医院,医学院,上海交通大学)

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24706 2025-09-30 cs.RO 50%

LLM-Handover:Exploiting LLMs for Task-Oriented Robot-Human Handovers

Andreea Tulbure, Rene Zurbruegg, Timm Grigat, Marco Hutter

机构 * Robotics System Lab, ETH Zürich(机器人系统实验室,苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2025-09-30 cs.CR 50%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

Haoran Li, Yulin Chen, Jingru Zeng, Hao Peng, Huihao Jing, Wenbin Hu, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24231 2025-09-30 cs.CV 50%

EVLF-FM: Explainable Vision Language Foundation Model for Medicine

Yang Bai, Haoran Cheng, Yang Zhou, Jun Zhou, Arun Thirunavukarasu, Yuhe Ke, Jie Yao, Kanae Fukutsu, Chrystie Wan Ning Quek, Ashley Hong, Laura Gutierrez, Zhen Ling Teo, Darren Shu Jeng Ting, Brian T. Soetikno, Christopher S. Nielsen, Tobias Elze, Zengxiang Li, Linh Le Dinh, Hiok Hong Chan, Victor Koh, Marcus Tan, Kelvin Z. Li, Leonard Yip, Ching Yu Cheng, Yih Chung Tham, Gavin Siew Wei Tan, Leopold Schmetterer, Marcus Ang, Rahat Hussain, Jod Mehta, Tin Aung, Lionel Tim-Ee Cheng, Tran Nguyen Tuan Anh, Chee Leong Cheng, Tien Yin Wong, Nan Liu, Iain Beehuat Tan, Soon Thye Lim, Eyal Klang, Tony Kiat Hon Lim, Rick Siow Mong Goh, Yong Liu, Daniel Shu Wei Ting

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23955 2025-09-30 cs.CV 50%

ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation

Shilan Zhang, Jirui Huang, Ruilin Yao, Cong Wang, Yaxiong Chen, Peng Xu, Shengwu Xiong

机构 * Wuhan University of Technology(武汉理工大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23849 2025-09-30 cs.CV 50%

CE-FAM: Concept-Based Explanation via Fusion of Activation Maps

Michihiro Kuroki, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract)

Comments This paper has been accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23242 2025-09-30 cs.CV 50%

TATTOO: Training-free AesTheTic-aware Outfit recOmmendation

Yuntian Wu, Xiaonan Hu, Ziqi Zhou, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :chain-of-thought(abstract)

Comments 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01667 2025-09-30 cs.CV 50%

EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM

Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begüm Demir, Nicu Sebe, Paolo Rota

机构 * University of Trento(特伦托大学) BIFOLD and Technische Universität Berlin(BIFOLD和柏林技术大学) Technical University of Munich(慕尼黑技术大学) University of Pisa(比萨大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 26 篇

2509.24299 2025-09-30 cs.CV 82%

SVGThinker: Instruction-Aligned and Reasoning-Driven Text-to-SVG Generation

Hanqi Chen, Zhongyin Zhao, Ye Chen, Zhujin Liang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12948 2025-09-30 cs.LG cs.CL 81%

Probabilistic Soundness Guarantees in LLM Reasoning Chains

Weiqiu You, Anton Xue, Shreya Havaldar, Delip Rao, Helen Jin, Chris Callison-Burch, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04695 2025-09-30 cs.LG cs.AI stat.ML 81%

Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection

Xingwu Chen, Tianle Li, Difan Zou

机构 * School of Computing & Data Science(计算与数据科学学院) Institute of Data Science(数据科学研究院) The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 28 pages, 5 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24776 2025-09-30 cs.CV cs.AI 79%

VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding

Yizhuo Ding, Mingkang Chen, Zhibang Feng, Tong Xiao, Wanying Qu, Wenqi Shao, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shenzhen University(深圳大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06820 2025-09-30 cs.CL cs.SD eess.AS 79%

Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs

Wenyu Zhang, Yingxu He, Geyu Lin, Zhuohan Liu, Shuo Sun, Bin Wang, Xunlong Zou, Jeremy H. M. Wong, Qiongqiong Wang, Hardik B. Sailor, Nancy F. Chen, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 {}^{\text{2}} R), Agency for Science, Technology and Research (A*STAR)(信息与通信研究机构(I2R),科技研究局(A*STAR)) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心(CFAR),科技研究局(A*STAR))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15952 2025-09-30 cs.CL 79%

Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning

Chen Li, Nazhou Liu, Kai Yang

机构 * HPC-AI Tech(HPC-AI技术)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04117 2025-09-30 cs.CL 79%

Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks

Zhiwen Ruan, Yun Chen, Yutao Hou, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25100 2025-09-30 cs.LG cs.AI cs.CL 76%

ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation

Aasheesh Singh, Vishal Vaddina, Dagnachew Birru

机构 * Phi Labs, Quantiphi(Phi Labs,Quantiphi)

专题命中 其他推理 :reasoning(abstract,comments);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025, Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24663 2025-09-30 cs.CL cs.AI cs.LG 75%

InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation

Weilin Zhao, Zihan Zhou, Zhou Su, Chaojun Xiao, Yuxuan Li, Yanghao Li, Yudi Zhang, Weilun Zhao, Zhen Li, Yuxiang Huang, Ao Sun, Xu Han, Zhiyuan Liu

机构 * Tsinghua University(清华大学) OpenBMB(开放大脑实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05362 2025-09-30 cs.CL cs.AI cs.LG 67%

LLMs Are In-Context Bandit Reinforcement Learners

Giovanni Monea, Antoine Bosselut, Kianté Brantley, Yoav Artzi

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25176 2025-09-30 cs.LG cs.CL 62%

SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression

Haoming Wen, Yushi Bai, Juanzi Li, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25131 2025-09-30 cs.SD cs.AI cs.CL cs.CV cs.MM 62%

MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech

Chengyao Wang, Zhisheng Zhong, Bohao Peng, Senqiao Yang, Yuqi Liu, Haokun Gui, Bin Xia, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Code is available at https://github.com/dvlab-research/MGM-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24356 2025-09-30 cs.CL cs.AI 62%

Beyond Repetition: Text Simplification and Curriculum Learning for Data-Constrained Pretraining

Matthew Theodore Roque, Dan John Velasco

机构 * Samsung R&D Institute Philippines(三星菲律宾研发中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To be published in BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03779 2025-09-30 cs.CL cs.LG 62%

Sheaf Discovery with Joint Computation Graph Pruning and Flexible Granularity

Lei Yu, Jingcheng Niu, Zining Zhu, Xi Chen, Gerald Penn

机构 * University of Toronto(多伦多大学) UKP Lab(UKP实验室) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23755 2025-09-30 cs.CL cs.AI 62%

Understanding Textual Capability Degradation in Speech LLMs via Parameter Importance Analysis

Chao Wang, Rui-Chen Zheng, Yang Ai, Zhen-Hua Ling

机构 * National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家级工程研究中心) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23412 2025-09-30 cs.CL cs.LG 62%

Comparison of Scoring Rationales Between Large Language Models and Human Raters

Haowei Hua, Hong Jiao, Dan Song

机构 * Princeton University(普林斯顿大学) University of Maryland(马里兰大学) University of Iowa(爱荷华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 23 Pages, 4 Tables, 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏