arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-08 至 2025-08-08 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2508.04719 2025-08-08 cs.AI cs.LG 62%

GeoFlow: Agentic Workflow Automation for Geospatial Tasks

Amulya Bhattaram, Justin Chung, Stanley Chung, Ranit Gupta, Janani Ramamoorthy, Kartikeya Gullapalli, Diana Marculescu, Dimitrios Stamoulis

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACM SIGSPATIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02959 2025-08-08 cs.AI cs.LG 62%

Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow

Chia-Tung Ho, Jing Gong, Xufeng Yao, Yunsheng Bai, Abhishek B Akkur, Haoxing Ren

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 12 figures, under review for AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05344 2025-08-08 cs.AI 57%

NomicLaw: Emergent Trust and Strategic Argumentation in LLMs During Collaborative Law-Making

Asutosh Hota, Jussi P. P. Jokinen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05232 2025-08-08 cs.LG 57%

Cross-LoRA: A Data-Free LoRA Transfer Framework across Heterogeneous LLMs

Feifan Xia, Mingyang Liao, Yuyang Fang, Defang Li, Yantong Xie, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05585 2025-08-08 cs.CV 50%

DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition

Haijing Liu, Tao Pu, Hefeng Wu, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 15 篇

2508.05234 2025-08-08 cs.CL cs.AI 88%

Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation

Haonan Shangguan, Xiaocui Yang, Shi Feng, Daling Wang, Yifei Zhang, Ge Yu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05221 2025-08-08 cs.CV cs.AI cs.LG 87%

ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking

Xiao Wang, Liye Jin, Xufeng Lou, Shiao Wang, Lan Chen, Bo Jiang, Zhipeng Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04699 2025-08-08 cs.SE cs.AI cs.CL 84%

R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation

Martin Weyssow, Chengran Yang, Junkai Chen, Ratnadira Widyasari, Ting Zhang, Huihui Huang, Huu Hung Nguyen, Yan Naing Tun, Tan Bui, Yikun Li, Ang Han Wei, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21745 2025-08-08 cs.CV 78%

Few-Shot Vision-Language Reasoning for Satellite Imagery via Verifiable Rewards

Aybora Koksal, A. Aydin Alatan

专题命中 推理评测 :reasoning(title,abstract)

Comments ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL). 10 pages, 3 figures, 6 tables. Our model, training code and dataset will be at https://github.com/aybora/FewShotReasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05543 2025-08-08 cs.RO 67%

CleanUpBench: Embodied Sweeping and Grasping Benchmark

Wenbo Li, Guanting Chen, Tao Zhao, Jiyao Wang, Tianxin Hu, Yuwen Liao, Weixiang Guo, Shenghai Yuan

专题命中 推理评测 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10496 2025-08-08 cs.IR cs.AI cs.CL cs.LG 67%

ArXivBench: When You Should Avoid Using ChatGPT for Academic Writing

Ning Li, Jingran Zhang, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02926 2025-08-08 cs.LG cs.AI cs.HC 62%

GrandJury: A Collaborative Machine Learning Model Evaluation Protocol for Dynamic Quality Rubrics

Arthur Cho

机构 * Memoirji LLC(Memiorji公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 14 pages (incl. arXiv cover), 1 table, code & dataset links inside. Open-source implementation available on PyPI (grandjury package) and GitHub. Dataset available on Hugging Face under CC-BY-4.0 license

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02074 2025-08-08 cs.CL cs.LG 62%

The SMeL Test: A simple benchmark for media literacy in language models

Gustaf Ahdritz, Anat Kleiman

机构 * Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00255 2025-08-08 cs.CL cs.AI cs.MA cs.SE 62%

SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers

Yanzheng Xiang, Hanqi Yan, Shuyin Ouyang, Lin Gui, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05508 2025-08-08 cs.AI 57%

Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation

Roshita Bhonsle, Rishav Dutta, Sneha Vavilapalli, Harsh Seth, Abubakarr Jaye, Yapei Chang, Mukund Rungta, Emmanuel Aboah Boateng, Sadid Hasan, Ehi Nosakhare, Soundar Srinivasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft Corporation(微软公司) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05468 2025-08-08 cs.CL 57%

TASE: Token Awareness and Structured Evaluation for Multilingual Language Models

Chenzhuo Zhao, Xinda Wang, Yue Huang, Junting Lu, Ziqian Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05428 2025-08-08 cs.LG 57%

Group Causal Policy Optimization for Post-Training Large Language Models

Ziyin Gu, Jingyao Wang, Ran Zuo, Chuxiong Sun, Zeen Song, Changwen Zheng, Wenwen Qiang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04720 2025-08-08 cs.AI 57%

Who is a Better Player: LLM against LLM

Yingjie Zhou, Jiezhang Cao, Farong Wen, Li Xu, Yanwei Jiang, Jun Jia, Ronghui Li, Xiaohong Liu, Yu Zhou, Xiongkuo Min, Jie Guo, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) PengCheng Laboratory(鹏城实验室) Harvard Medical School(哈佛医学院) Shanghai AI Laboratory(上海人工智能实验室) China University of Mining and Technology(中国矿业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19168 2025-08-08 cs.CL 57%

Language Model Uncertainty Quantification with Attention Chain

Yinghao Li, Rushi Qiang, Lama Moukheiber, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 36 pages, 7 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17519 2025-08-08 cs.CL 57%

Large Language Models Still Exhibit Bias in Long Text

Wonje Jeung, Dongjae Jeon, Ashkan Yousefpour, Jonghyun Choi

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL, code and models are available at https://github.com/WonjeJeung/LTF-TEST

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 9 篇

2508.04848 2025-08-08 cs.AI 80%

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Chang Tian, Matthew B. Blaschko, Mingzhe Xing, Xiuxing Li, Yinliang Yue, Marie-Francine Moens

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

Comments large language models, large vision-language model, reasoning, non-ideal conditions, reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09032 2025-08-08 cs.LG cs.AI cs.CL 67%

Teaching LLMs How to Learn with Contextual Fine-Tuning

Younwoo Choi, Muhammad Adil Asif, Ziwen Han, John Willes, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00708 2025-08-08 cs.CL cs.AI cs.HC cs.LG 67%

Understanding Large Language Model Behaviors through Interactive Counterfactual Generation and Analysis

Furui Cheng, Vilém Zouhar, Robin Shing Moon Chan, Daniel Fürst, Hendrik Strobelt, Mennatallah El-Assady

机构 * ETH Zürich(苏黎世联邦理工学院) University of Konstanz(康斯坦茨大学) IBM Research(IBM研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05613 2025-08-08 cs.CL cs.AI 62%

Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models

Haitao Hong, Yuchen Yan, Xingyu Wu, Guiyang Hou, Wenqi Zhang, Weiming Lu, Yongliang Shen, Jun Xiao

机构 * Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://zju-real.github.io/cooper Code: https://github.com/zju-real/cooper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05003 2025-08-08 cs.CL cs.AI 62%

A Multi-Stage Large Language Model Framework for Extracting Suicide-Related Social Determinants of Health

Song Wang, Yishu Wei, Haotian Ma, Max Lovitt, Kelly Deng, Yuan Meng, Zihan Xu, Jingze Zhang, Yunyu Xiao, Ying Ding, Xuhai Xu, Joydeep Ghosh, Yifan Peng

机构 * Cockrell School of Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校工程学院) Population Health Sciences, Weill Cornell Medicine(韦尔·柯尔医学中心流行病学与卫生科学系) School of Information, The University of Texas at Austin(德克萨斯大学奥斯汀分校信息学院) Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16936 2025-08-08 cs.CL cs.AI 62%

Rationale-guided Prompting for Knowledge-based Visual Question Answering

Zhongjian Hu, Peng Yang, Bing Li, Fengyuan Liu

专题命中 其他推理 :CoT(abstract);分类 cs.CL、cs.AI

Comments We would like to withdraw this submission due to ongoing internal review and coordination among the author team. Upon the supervisor's recommendation, we have decided to delay public dissemination until the manuscript undergoes further refinement and aligns with our intended academic trajectory

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05427 2025-08-08 cs.AI 57%

Large Language Models Transform Organic Synthesis From Reaction Prediction to Automation

Kartar Kumar Lohana Tharwani, Rajesh Kumar, Sumita, Numan Ahmed, Yong Tang

机构 * International Research Center for Complexity Sciences, Hangzhou International Innovation Institute, Beihang University(国际复杂科学研究中心,杭州创新研究院,北京航空航天大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) Yangtze Delta Region Institute (Huzhou), University of Electronic Science and Technology of China(长江三角洲地区研究所(湖州),电子科学与技术大学) Government Boys Higher Secondary School, Bukera Sharif, Tando Allahyar, Affiliated with BISE Hyderabad, Sindh, Pakistan(政府男生高级中学,布克里·沙里夫,塔ndo阿勒·耶尔,隶属于Hyderabad BISE,Sindh,巴基斯坦) School of Environment and Architecture, University of Shanghai for Science and Technology(环境与建筑学院,上海科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12496 2025-08-08 cs.CL cs.HC 57%

Improving Factuality for Dialogue Response Generation via Graph-Based Knowledge Augmentation

Xiangyan Chen, Yujian Gan, Yimeng Gu, Matthew Purver

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07132 2025-08-08 cs.AI cs.DB 57%

Interactive Data Harmonization with LLM Agents: Opportunities and Challenges

Aécio Santos, Eduardo H. M. Pena, Roque Lopez, Juliana Freire

机构 * New York University(纽约大学) Federal University of Technology - Paraná(帕拉州技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

Journal ref In Novel Optimizations for Visionary AI Systems (NOVAS '25), June 22-27, 2025. Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏