arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-09 至 2025-10-09 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 25 篇

2510.06587 2025-10-09 cs.AI 77%

WebDART: Dynamic Decomposition and Re-planning for Complex Web Tasks

Jingbo Yang, Bairu Hou, Wei Wei, Shiyu Chang, Yujia Bao

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06357 2025-10-09 cs.RO cs.AI 77%

Constrained Natural Language Action Planning for Resilient Embodied Systems

Grayson Byrd, Corban Rivera, Bethany Kemp, Meghan Booker, Aurora Schmidt, Celso M de Melo, Lalithkumar Seenivasan, Mathias Unberath

机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Lab(国防部陆军研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25282 2025-10-09 cs.AI cs.HC cs.SE 77%

Toward Causal-Visual Programming: Enhancing Agentic Reasoning in Low-Code Environments

Jiexi Xu, Jiaqi Liu, Lanruo Wang, Su Liu

机构 * School of Information \& Computer Science University of California, Irvine Irvine, CA, USA Independent Researcher University of Texas at Dallas Dallas, TX, USA Georgia Institute of Technology Atlanta, GA, USA

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12009 2025-10-09 cs.CV 75%

CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion

Yolo Yunlong Tang, Gen Zhan, Li Yang, Yiting Liao, Chenliang Xu

机构 * ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06274 2025-10-09 cs.AI cs.LG 73%

Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization

Mohammad Mahdi Samiei Paqaleh, Arash Marioriyad, Arman Tahmasebi-Zadeh, Mohamadreza Fereydooni, Mahdi Ghaznavai, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering(计算机工程系) Sharif University of Technology(沙里夫技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07167 2025-10-09 cs.CL 70%

Reasoning for Hierarchical Text Classification: The Case of Patents

Lekang Jiang, Wenjun Sun, Stephan Goetz

机构 * University of Cambridge(剑桥大学) National Science Library, Chinese Academy of Sciences(中国科学院国家科学图书馆) Department of Information Resources Management, School of Economics and Management, University of Chinese Academy of Sciences(中国科学院大学经济管理学院信息资源管理系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20757 2025-10-09 cs.CL 70%

MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search

Yunhai Hu, Yilun Zhao, Chen Zhao, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06579 2025-10-09 cs.CL 70%

TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents

Haofei Yu, Keyang Xuan, Fenghai Li, Kunlun Zhu, Zijie Lei, Jiaxun Zhang, Ziheng Qi, Kyle Richardson, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 7 pages, EMNLP 2025 Demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05379 2025-10-09 cs.CR cs.AI 70%

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19333 2025-10-09 cs.IR cs.CL 70%

Injecting External Knowledge into the Reasoning Process Enhances Retrieval-Augmented Generation

Minghao Tang, Shiyu Ni, Jiafeng Guo, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology(计算技术研究所) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13055 2025-10-09 cs.RO cs.AI 70%

Mitigating Cross-Modal Distraction and Ensuring Geometric Feasibility via Affordance-Guided and Self-Consistent MLLMs for Task Planning in Instruction-Following Manipulation

Yu-Hong Shen, Chuan-Yu Wu, Yi-Ru Yang, Yen-Ling Tai, Yi-Ting Chen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学) Department of Computer Science and Information Engineering, National Taiwan University(计算机科学与信息工程系,台湾大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06559 2025-10-09 cs.CL cs.AI cs.LO 62%

The Algebra of Meaning: Why Machines Need Montague More Than Moore's Law

Cheonkam Jeong, Sungdo Kim, Jewoo Park

机构 * Savassan(萨瓦桑)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24031 2025-10-09 cs.LG cs.AI cs.CV cs.MA 62%

GPS-MTM: Capturing Pattern of Normalcy in GPS-Trajectories with self-supervised learning

Umang Garg, Bowen Zhang, Anantajit Subrahmanya, Chandrakanth Gudavalli, BS Manjunath

机构 * ECE Department(电子工程系) University of California(加州大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06954 2025-10-09 cs.LG 57%

From Condensation to Rank Collapse: A Two-Stage Analysis of Transformer Training Dynamics

Zheng-An Chen, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, MOE-LSC, CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学自然科学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 48 篇

2510.02360 2025-10-09 cs.CL cs.AI 90%

Spiral of Silence in Large Language Model Agents

Mingze Zhong, Meng Fang, Zijing Shi, Yuxuan Huang, Shunfeng Zheng, Yali Du, Ling Chen, Jun Wang

机构 * AAII, University of Technology Sydney(AAII,悉尼大学) University of Liverpool(利物浦大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06931 2025-10-09 astro-ph.IM cs.LG 89%

Textual interpretation of transient image classifications from large language models

Fiorenzo Stoppa, Turan Bulmus, Steven Bloemen, Stephen J. Smartt, Paul J. Groot, Paul Vreeswijk, Ken W. Smith

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments Published in Nature Astronomy (2025). Publisher's Version of Record (CC BY 4.0). DOI: 10.1038/s41550-025-02670-z

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05468 2025-10-09 cs.CL 89%

LatteReview: A Multi-Agent Framework for Systematic Review Automation Using Large Language Models

Pouria Rouzrokh, Bardia Khosravi, Parsa Rouzrokh, Moein Shariatnia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 31 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06826 2025-10-09 cs.CL 89%

Mid-Training of Large Language Models: A Survey

Kaixiang Mo, Yuxin Shi, Weiwei Weng, Zhiqiang Zhou, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09278 2025-10-09 cs.CV cs.AI 88%

Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine

Xiaoshuang Huang, Lingdong Shen, Jia Liu, Fangxin Shang, Hongxiang Li, Haifeng Huang, Yehui Yang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06430 2025-10-09 cs.CL 88%

MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning

Neeraja Kirtane, Yuvraj Khanna, Peter Relan

机构 * Got It Education(Got It 教育)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04155 2025-10-09 cs.CL 88%

GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models

Hengyu Luo, Zihao Li, Joseph Attieh, Sawal Devkota, Ona de Gibert, Xu Huang, Shaoxiong Ji, Peiqin Lin, Bhavani Sai Praneeth Varma Mantina, Ananda Sreenidhi, Raúl Vázquez, Mengjie Wang, Samea Yusofi, Fei Yuan, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Munich(慕尼黑大学) Nanjing University(南京大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP demo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19017 2025-10-09 cs.CL 88%

Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models

Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Project website: https://yxg1005.github.io/GaslightingNegationAttacks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20553 2025-10-09 cs.SE 88%

GeoJSEval: An Automated Evaluation Framework for Large Language Models on JavaScript-Based Geospatial Computation and Visualization Code Generation

Guanyu Chen, Haoyue Jiao, Shuyang Hou, Ziqi Liu, Lutong Xie, Shaowen Wu, Huayi Wu, Xuefeng Guan, Zhipeng Gui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07243 2025-10-09 cs.CL cs.AI 86%

LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation

Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha, Arijit Ghosh Chowdhury, Prashanth Kallur Ramaswamy, Jeremy Roghair, Hannah R Marlowe, Carina Suzana Negreanu, Kitty Boxall, Diana Mincu

机构 * Robin AI Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in Natural Legal Language Processing - EMNLP Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07173 2025-10-09 cs.CL cs.LG 86%

NurseLLM: The First Specialized Language Model for Nursing

Md Tawkat Islam Khondaker, Julia Harrington, Shady Shehata

机构 * Yourika Labs(Yourika实验室) The University of British Columbia(不列颠哥伦比亚大学) Western University(西方大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07083 2025-10-09 cs.CL 85%

All Claims Are Equal, but Some Claims Are More Equal Than Others: Importance-Sensitive Factuality Evaluation of LLM Generations

Miriam Wanner, Leif Azzopardi, Paul Thomas, Soham Dan, Benjamin Van Durme, Nick Craswell

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软) University of Strathclyde(斯特拉思克莱德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14146 2025-10-09 cs.CL 85%

MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation

Xian Gao, Jiacheng Ruan, Zongyun Zhang, Jingsheng Gao, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06253 2025-10-09 cs.CY cs.AI 85%

LLM-Driven Rubric-Based Assessment of Algebraic Competence in Multi-Stage Block Coding Tasks with Design and Field Evaluation

Yong Oh Lee, Byeonghun Bang, Sejun Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06231 2025-10-09 cs.CV cs.CL 85%

CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation

Mingzhe Zheng, Dingjie Song, Guanyu Zhou, Jun You, Jiahao Zhan, Xuran Ma, Xinyuan Song, Ser-Nam Lim, Qifeng Chen, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Lehigh University(莱斯大学) Fudan University(复旦大学) Emory University(埃默里大学) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04764 2025-10-09 cs.CL 85%

Are BabyLMs Deaf to Gricean Maxims? A Pragmatic Evaluation of Sample-efficient Language Models

Raha Askari, Sina Zarrieß, Özge Alacam, Judith Sieker

机构 * Department of Humanities, University of Turin(都灵大学人文学科系) Computational Linguistics, Department of Linguistics, Bielefeld University(比勒菲尔德大学语言学系计算语言学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted for the BabyLM workshop in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏