arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-01 至 2025-10-01 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 58 篇

2509.25598 2025-10-01 cs.AI cs.LG 73%

Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks

Peiran Xu, Zhuohao Li, Xiaoying Xing, Guannan Zhang, Debiao Li, Kunyu Shi

机构 * Accio Team, Alibaba Group(阿里集团阿西莫团队) University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25586 2025-10-01 cs.AI cs.CL 73%

ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning

Jihye Choi, Jinsung Yoon, Jiefeng Chen, Somesh Jha, Tomas Pfister

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Google Cloud(谷歌云)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25559 2025-10-01 cs.AI cs.LG 73%

Radiology's Last Exam (RadLE): Benchmarking Frontier Multimodal AI Against Human Experts and a Taxonomy of Visual Reasoning Errors in Radiology

Suvrankar Datta, Divya Buchireddygari, Lakshmi Vennela Chowdary Kaza, Mrudula Bhalke, Kautik Singh, Ayush Pandey, Sonit Sai Vasipalli, Upasana Karnwal, Hakikat Bir Singh Bhatti, Bhavya Ratan Maroo, Sanjana Hebbar, Rahul Joseph, Gurkawal Kaur, Devyani Singh, Akhil V, Dheeksha Devasya Shama Prasad, Nishtha Mahajan, Ayinaparthi Arisha, Rajesh Vanagundi, Reet Nandy, Kartik Vuthoo, Snigdhaa Rajvanshi, Nikhileswar Kondaveeti, Suyash Gunjal, Rishabh Jain, Rajat Jain, Anurag Agrawal

机构 * Centre for Responsible Autonomous Systems in Healthcare (CRASH) Lab, Koita Centre for Digital Health(负责任的自主医疗系统中心(CRASH)实验室、Koita数字健康中心) Ashoka University(阿什oka大学) Independent Researcher(独立研究者) Koita Centre for Digital Health(Koita数字健康中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 29 pages, 7 figures, 7 tables, includes Annexure (1). Part of the work accepted at RSNA 2025 (Cutting Edge Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25301 2025-10-01 cs.AI cs.CL 73%

Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution

Tianrui Qin, Qianben Chen, Sinuo Wang, He Xing, King Zhu, He Zhu, Dingfeng Shi, Xinxin Liu, Ge Zhang, Jiaheng Liu, Yuchen Eleanor Jiang, Xitong Gao, Wangchunshu Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01317 2025-10-01 cs.CL cs.AI 73%

Adaptive Rectification Sampling for Test-Time Compute Scaling

Zhendong Tan, Xingjun Zhang, Chaoyi Hu, Yancheng Pan, Shaoxun Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22048 2025-10-01 cs.CL cs.LG 73%

ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models

Chung-En Sun, Ge Yan, Tsui-Wei Weng

机构 * UCSD CSE(加州大学圣地亚哥分校计算机科学系) UCSD HDSI(加州大学圣地亚哥分校人类发展与应用科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06105 2025-10-01 cs.CV 71%

PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathology

Yating Huang, Ziyan Huang, Lintao Xiang, Qijun Yang, Hujun Yin

机构 * University of Manchester(曼彻斯特大学) South China University of Technology(华南理工大学)

专题命中 推理与问题求解 :language model(title)

Comments Accept by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15855 2025-10-01 cs.AI 70%

Winning Gold at IMO 2025 with a Model-Agnostic Verification-and-Refinement Pipeline

Yichen Huang, Lin F. Yang

机构 * Department of Electrical and Computer Engineering, and Department of Computer Science, UCLA(电气与计算机工程系和计算机科学系, UCLA)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26161 2025-10-01 cs.AI cs.SE 70%

90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development

Runxin Yang, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26062 2025-10-01 cs.CL 70%

DyFlow: Dynamic Workflow Framework for Agentic Reasoning

Yanbo Wang, Zixiang Xu, Yue Huang, Xiangqi Wang, Zirui Song, Lang Gao, Chenxi Wang, Xiangru Tang, Yue Zhao, Arman Cohan, Xiangliang Zhang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎大学人工智能大学) University of Notre Dame(诺特大学) Yale University(耶鲁大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25916 2025-10-01 cs.CV cs.CL 70%

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

Peng Liu, Haozhan Shen, Chunxin Fang, Zhicheng Sun, Jiajia Liao, Tiancheng Zhao

机构 * Om AI Research(Om AI研究机构) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25811 2025-10-01 cs.CV cs.LG 70%

Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition

Zichen Liang, Jingjing Fei, Jie Wang, Zheming Yang, Changqing Li, Pei Wu, Minghui Qiu, Fei Yang, Xialei Liu

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25733 2025-10-01 cs.CL 70%

CATCH: A Novel Data Synthesis Framework for High Therapy Fidelity and Memory-Driven Planning Chain of Thought in AI Counseling

Mingyu Chen, Jingkai Lin, Zhaojie Chu, Xiaofen Xing, Yirong Chen, Xiangmin Xu

机构 * School of EE South China University of Technology Guangzhou China(华南理工大学电子工程学院) Foshan University Foshan China(佛山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments To be published in EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25725 2025-10-01 cs.CL 70%

Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities

Jiayi Kuang, Haojing Huang, Yinghui Li, Xinnian Liang, Zhikun Xu, Yangning Li, Xiaoyu Tan, Chao Qu, Meishan Zhang, Ying Shen, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc(字节跳动公司) Arizona State University(亚利桑那州立大学) Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25530 2025-10-01 cs.AI 70%

Beyond Static Retrieval: Opportunities and Pitfalls of Iterative Retrieval in GraphRAG

Kai Guo, Xinnan Dai, Shenglai Zeng, Harry Shomer, Haoyu Han, Yu Wang, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Oregon(俄勒冈大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25642 2025-10-01 physics.ed-ph 67%

Help or Hype? Students' Engagement and Perception of Using AI to Solve Physics Problems

Qurat-ul-Ann Mirza, N. Sanjay Rebello

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06637 2025-10-01 cs.MM 67%

SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas

Chenghao Ma, Haihong E., Junpeng Ding, Jun Zhang, Ziyan Ma, Huang Qing, Bofei Gao, Liang Chen, Yifan Zhu, Meina Song

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments Submitted to ICCV 2025. 11 pages (including references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26594 2025-10-01 cs.LG cs.CL cs.CV 62%

Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces

John Gkountouras, Ivan Titov

机构 * ILLC, University of Amsterdam(伊拉斯谟范例学院、阿姆斯特丹大学) ILCC, University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25757 2025-10-01 cs.AI cs.CL cs.CV cs.SC 62%

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Danial Kamali, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25343 2025-10-01 cs.AI cs.CL 62%

Spontaneous High-Order Generalization in Neural Theory-of-Mind Networks

Yiming Wang, Rui Wang

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03214 2025-10-01 cs.CL cs.AI cs.CV 62%

iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs

Julius Mayer, Mohamad Ballout, Serwan Jassim, Farbod Nosrat Nezami, Elia Bruni

机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26375 2025-10-01 cs.RO cs.AI cs.CV 57%

SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning

Zichao Shen, Chen Gao, Jiaqi Yuan, Tianchen Zhu, Xingcheng Fu, Qingyun Sun

机构 * Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26225 2025-10-01 cs.CV cs.AI 57%

An Experimental Study on Generating Plausible Textual Explanations for Video Summarization

Thomas Eleftheriadis, Evlampios Apostolidis, Vasileios Mezaris

机构 * IEEE CBMI 2025

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

Comments IEEE CBMI 2025. This is the authors' accepted version. The final publication is available at https://ieeexplore.ieee.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26039 2025-10-01 cs.CV 50%

SGS: Segmentation-Guided Scoring for Global Scene Inconsistencies

Gagandeep Singh, Samudi Amarsinghe, Urawee Thani, Ki Fung Wong, Priyanka Singh, Xue Li

专题命中 推理与问题求解 :language model(abstract)

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26012 2025-10-01 cs.CV 50%

SETR: A Two-Stage Semantic-Enhanced Framework for Zero-Shot Composed Image Retrieval

Yuqi Xiao, Yingying Zhu

机构 * Yuqi Xiao, Yingying Zhu

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25852 2025-10-01 cs.RO 50%

Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation

Zitong Bo, Yue Hu, Jinming Ma, Mingliang Zhou, Junhui Yin, Yachen Kang, Yuqi Liu, Tong Wu, Diyun Xiang, Hao Chen

机构 * Xiaomi Robotics Lab(小米机器人实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 57 篇

2502.11569 2025-10-01 cs.CL cs.AI cs.LG 92%

Towards Reasoning Ability of Small Language Models

Gaurav Srivastava, Shuxiang Cao, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, USA(弗吉尼亚理工大学计算机科学系) Department of Physics, Clarendon Laboratory, University of Oxford, UK(牛津大学物理系,克伦德尔实验室) NVIDIA Corporation(英伟达公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25197 2025-10-01 cs.SE cs.AI cs.PL 90%

Towards Repository-Level Program Verification with Large Language Models

Si Cheng Zhong, Xujie Si

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to LMPL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25813 2025-10-01 cs.CL cs.LG 90%

RoBiologyDataChoiceQA: A Romanian Dataset for improving Biology understanding of Large Language Models

Dragos-Dumitru Ghinea, Adela-Nicoleta Corbeanu, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25207 2025-10-01 cs.LG cs.AI 90%

Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models

Yebin Lim, Susik Yoon

机构 * Computer Science and Engineering Korea University(计算机科学与工程韩国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏