arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-06 至 2025-10-06 共收录 167 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 29 篇

2507.04404 2025-10-06 cs.AI 88%

LayerCake: Token-Aware Contrastive Decoding within Large Language Model Layers

Jingze Zhu, Yongliang Wu, Wenbo Zhu, Jiawang Cao, Yanqiang Zheng, Jiawei Chen, Xu Yang, Bernt Schiele, Jonas Fischer, Xinting Hu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments The submission was made before undergoing the required review by the co-authors' affiliated institutions. We are withdrawing the paper to allow for the completion of the institutional review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08970 2025-10-06 cs.AI 87%

Gala: Global LLM Agents for Text-to-Model Translation

Junyang Cai, Serdar Kadioglu, Bistra Dilkina

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02816 2025-10-06 cs.AI cs.CL 86%

NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning

Yulong Zhang, Li Wang, Wei Du, Peilin Li, Yuqin Dai Zhiyuan Zhao, Lingyong Fang, Ziniu Liu, Ru Zhang, Huijia Zhu, Gongshen Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Inner Mongolia Research Institute of SJTU(内蒙古大学SJTU研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02377 2025-10-06 cs.CL cs.LG 86%

Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems

Aakriti Agrawal, Rohith Aralikatti, Anirudh Satheesh, Souradip Chakraborty, Amrit Singh Bedi, Furong Huang

机构 * University of Maryland(马里兰大学) Hilabs University of Central Florida(佛罗里达中央大学) Capital One

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02780 2025-10-06 cs.CV 83%

Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models

Prahitha Movva

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);LLM(journal_ref)

Journal ref COLM 2025: First Workshop on the Application of LLM Explainability to Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02719 2025-10-06 cs.CL cs.AI 81%

TravelBench : Exploring LLM Performance in Low-Resource Domains

Srinivas Billa, Xiaonan Jing

机构 * Expedia Group(Expedia集团)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02668 2025-10-06 cs.IR cs.AI 79%

AgenticRAG: Tool-Augmented Foundation Models for Zero-Shot Explainable Recommender Systems

Bo Ma, Hang Li, ZeHua Hu, XiaoFan Gui, LuYao Liu, Simon Liu

机构 * Department of Software \& Microelectronics Peking University Beijing, China Department of Software \& Microelectronics Peking University Beijing, China hangli\ Department of Software \& Microelectronics Peking University Beijing, China zehua\ Department of Software \& Microelectronics Peking University Beijing, China xiaofan\ Economic Law School China University of Political Science School of Computer Science Peking University Beijing, China

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03153 2025-10-06 cs.AI cs.MA cs.RO 77%

Improving Cooperation in Collaborative Embodied AI

Hima Jacob Leven Suprabha, Laxmi Nag Laxminarayan Nagesh, Ajith Nair, Alvin Reuben Amal Selvaster, Ayan Khan, Raghuram Damarla, Sanju Hannah Samuel, Sreenithi Saravana Perumal, Titouan Puech, Venkataramireddy Marella, Vishal Sonar, Alessandro Suglia, Oliver Lemon

机构 * School of Mathematical and Computer Sciences(数学与计算机科学学院) Heriot-Watt University(赫里奥特-沃森大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments In proceedings of UKCI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02634 2025-10-06 cs.SE cs.AI 77%

Automatic Building Code Review: A Case Study

Hanlong Wan, Weili Xu, Michael Rosenberg, Jian Zhang, Aysha Siddika

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07052 2025-10-06 cs.LG 77%

To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning

Tian Qin, David Alvarez-Melis, Samy Jelassi, Eran Malach

机构 * Harvard University(哈佛大学) Kempner Institute(凯普纳研究所) MSR(微软研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments COLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00579 2025-10-06 cs.MM cs.IR 75%

MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning

Ziyu Gong, Chengcheng Mai, Yihua Huang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Comments: Update Title, Author, Abstract, etc

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17746 2025-10-06 cs.LG cs.AI cs.CL 75%

Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains

Anisha Gunjal, Anthony Wang, Elaine Lau, Vaskar Nath, Yunzhong He, Bing Liu, Sean Hendryx

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21710 2025-10-06 cs.SE 75%

Enhancing repository-level software repair via repository-aware knowledge graphs

Boyang Yang, Jiadong Ren, Shunfu Jin, Yang Liu, Feng Liu, Bach Le, Haoye Tian

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02351 2025-10-06 cs.CL cs.AI 73%

Language, Culture, and Ideology: Personalizing Offensiveness Detection in Political Tweets with Reasoning LLMs

Dzmitry Pihulski, Jan Kocoń

机构 * Department of Artificial Intelligence, Wroclaw Tech, Poland(人工智能系,沃拉布技术学院,波兰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To appear in the Proceedings of the IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17121 2025-10-06 cs.CL cs.AI 73%

NeSyGeo: A Neuro-Symbolic Framework for Multimodal Geometric Reasoning Data Generation

Weiming Wu, Jin Ye, Zi-kang Wang, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03178 2025-10-06 cs.SE cs.CL 70%

When Names Disappear: Revealing What LLMs Actually Understand About Code

Cuong Chi Le, Minh V. T. Pham, Cuong Duc Van, Hoang N. Phan, Huy N. Phan, Tien N. Nguyen

机构 * FPT Software AI Center(FPT软件AI中心) Nanyang Technological University(南洋理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02892 2025-10-06 cs.LG 70%

RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning

Aleksei Arzhantsev, Otmane Sakhi, Flavian Vasile

机构 * Criteo AI Lab(Criteo人工智能实验室) Ecole Polytechnique Paris(巴黎高等理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted to the Efficient Reasoning Workshop at NeuRIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02827 2025-10-06 cs.CL cs.IR 70%

StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering

Tengjun Ni, Xin Yuan, Shenghong Li, Kai Wu, Ren Ping Liu, Wei Ni, Wenjie Zhang

机构 * University of Technology Sydney, Australia(澳大利亚技术大学) Data61, CSIRO, Australia(数据61,CSIRO) School of Engineering, Edith Cowan University, Australia(埃迪斯·科温大学工程学院) University of New South Wales, Australia(新南威尔士大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02325 2025-10-06 cs.CR cs.AI 70%

Agentic-AI Healthcare: Multilingual, Privacy-First Framework with MCP Agents

Mohammed A. Shehab

机构 * Concordia Continuing Education(康科德继续教育) Concordia University(康科德大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 6 pages, 1 figure. Submitted as a system/vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04697 2025-10-06 cs.CL cs.AI cs.LG 67%

L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning

Pranjal Aggarwal, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03194 2025-10-06 cs.AI 57%

CoDA: Agentic Systems for Collaborative Data Visualization

Zichen Chen, Jiefeng Chen, Sercan Ö. Arik, Misha Sra, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of California, Santa Barbara(加州大学圣巴bara分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments 31 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03149 2025-10-06 cs.LG cs.DS 57%

Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking

Dhruv Rohatgi, Abhishek Shetty, Donya Saless, Yuchen Li, Ankur Moitra, Andrej Risteski, Dylan J. Foster

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 44 篇

2507.16076 2025-10-06 cs.CL 92%

The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Models

Marlene Lutz, Indira Sen, Georg Ahnert, Elisa Rogers, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02347 2025-10-06 cs.CL cs.AI 91%

Small Language Models for Curriculum-based Guidance

Konstantinos Katharakis, Sippo Rossi, Raghava Rao Mukkamala

机构 * Copenhagen Business School(哥本哈根商学院) Hanken School of Economics(汉肯经济学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02962 2025-10-06 cs.CL 90%

Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking

Jingqi Zhang, Ruibo Chen, Yingqing Yang, Peihua Mai, Heng Huang, Yan Pang

机构 * Antiquus S. Hippocampus, Natalia Cerebro & Amelie P. Amygdale Department of Computer Science Cranberry-Lemon University Pittsburgh, PA 15213, USA(计算机科学系,Cranberry-Lemon大学) Ji Q. Ren & Yevgeny LeNet Department of Computational Neuroscience University of the Witwatersrand Joburg, South Africa(计算神经科学系,沃特瓦特斯兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01761 2025-10-06 cs.CL 90%

Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models

Tobias Domhan, Dawei Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted at EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02830 2025-10-06 cs.CL cs.AI 90%

Evaluating Large Language Models for IUCN Red List Species Information

Shinya Uryu

机构 * Center for Design-Oriented AI Education and Research(设计导向人工智能教育与研究中心) Tokushima University(德岛大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02663 2025-10-06 cs.LG cs.AI 90%

TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models

Rakshith S Srinivasa, Zora Che, Chen Bo Calvin Zhang, Diego Mares, Ernesto Hernandez, Jayeon Park, Dean Lee, Guillermo Mangialardi, Charmaine Ng, Ed-Yeremai Hernandez Cardona, Anisha Gunjal, Yunzhong He, Bing Liu, Chen Xing

机构 * Scale AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02403 2025-10-06 q-bio.QM cs.AI cs.CV 89%

Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model

Jalil Jalili, Yashraj Gavhane, Evan Walker, Anna Heinke, Christopher Bowd, Akram Belghith, Massimo A. Fazio, Christopher A. Girkin, C. Gustavo De Moraes, Jeffrey M. Liebmann, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10150 2025-10-06 cs.CL cs.HC 89%

When Large Language Models are Reliable for Judging Empathic Communication

Aakriti Kumar, Nalin Poungpeth, Diyi Yang, Erina Farrell, Bruce Lambert, Matthew Groh

机构 * Kellogg School of Management(凯洛格管理学院) Northwestern University(西北大学) Northwestern Institute for Complex Systems(西北复杂系统研究所) Stanford University(斯坦福大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏