arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-08 至 2025-09-08 共收录 150 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 2 篇

2509.04820 2025-09-08 cs.IR 75%

Fishing for Answers: Exploring One-shot vs. Iterative Retrieval Strategies for Retrieval Augmented Generation

Huifeng Lin, Gang Su, Jintao Liang, You Wu, Rui Zhao, Ziyue Li

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

Comments under Review of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 18 篇

2509.04468 2025-09-08 cs.CL cs.AI 91%

Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study

Xuan Yao, Qianteng Wang, Xinbo Liu, Ke-Wei Huang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04502 2025-09-08 cs.CL cs.AI 90%

VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples

Qixin Sun, Ziqin Wang, Hengyuan Zhao, Yilin Li, Kaiyou Song, Linjiang Huang, Xiaolin Hu, Qingpei Guo, Si Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18724 2025-09-08 cs.CL 89%

Large Language Models with Temporal Reasoning for Longitudinal Clinical Summarization and Prediction

Maya Kruse, Shiyue Hu, Nicholas Derby, Yifu Wu, Samantha Stonbraker, Bingsheng Yao, Dakuo Wang, Elizabeth Goldberg, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校园) University of Colorado Boulder(科罗拉多大学波德分校) Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04475 2025-09-08 cs.CL cs.AI 86%

ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute

Hao Wen, Yifan Su, Feifei Zhang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, Yuanchun Li

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究所(AIR)清华大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04705 2025-09-08 cs.HC 83%

Transforming Fashion with AI: A Comparative Study of Large Language Models in Apparel Design

Nusrat Jahan Lamia, Sadia Afrin Mim

专题命中 推理与问题求解 :large language model(title);language model(title)

Journal ref https://www.butex.edu.bd/conference-2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05199 2025-09-08 cs.CL 81%

Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework

David Herrera-Poyatos, Carlos Peláez-González, Cristina Zuheros, Virilo Tejedor, Rosana Montes, Francisco Herrera

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) Andalusian Institute of Data Science and Computational Intelligence(安达卢西亚数据科学与计算智能研究所) University of Granada(格拉纳达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 27 pages, 9 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09061 2025-09-08 cs.PL cs.LG 79%

CRANE: Reasoning with constrained LLM generation

Debangshu Banerjee, Tarun Suresh, Shubham Ugare, Sasa Misailovic, Gagandeep Singh

机构 * Department of Computer Science, University of Illinois Urbana-Champaign, USA(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

Comments Accepted at ICML 2025, Code at: https://github.com/uiuc-focal-lab/CRANE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00461 2025-09-08 cs.CL cs.AI 79%

TECP: Token-Entropy Conformal Prediction for LLMs

Beining Xu, Yongming Lu

机构 * Department of School of Engineering, Shenzhen MSU-BIT University, Shenzhen, China, 518000(深圳MSU-BIT大学工程学院部门) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU-BIT University, Shenzhen, China, 518000(应用数学联合研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04470 2025-09-08 cs.CL cs.AI 79%

COCORELI: Cooperative, Compositional Reconstitution \& Execution of Language Instructions

Swarnadeep Bhar, Omar Naim, Eleni Metheniti, Bastien Navarri, Loïc Cabannes, Morteza Ezzabady, Nicholas Asher

机构 * IRIT ENS Paris-Saclay(巴黎-萨克雷大学) CNRS(国家科学研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05226 2025-09-08 cs.CL 77%

Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation

Abdul Waheed, Chancharik Mitra, Laurie Z. Wang, Deva Ramanan, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :post-training(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL

Comments 28 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04716 2025-09-08 cs.CL cs.AI cs.IR 73%

KERAG: Knowledge-Enhanced Retrieval-Augmented Generation for Advanced Question Answering

Yushi Sun, Kai Sun, Yifan Ethan Xu, Xiao Yang, Xin Luna Dong, Nan Tang, Lei Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04979 2025-09-08 cs.AI 70%

Internet 3.0: Architecture for a Web-of-Agents with it's Algorithm for Ranking Agents

Rajesh Tembarai Krishnamachari, Srividya Rajesh

机构 * NYU(纽约大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06020 2025-09-08 cs.AI cs.CV 70%

ArtRAG: Retrieval-Augmented Generation with Structured Context for Visual Art Understanding

Shuai Wang, Ivona Najdenkoska, Hongyi Zhu, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) College of Business(商学院) Economics, University of Johannesburg(经济系,约翰内斯堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16299 2025-09-08 cs.SE cs.AI 70%

HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale

Huy Nhat Phan, Tien N. Nguyen, Phong X. Nguyen, Nghi D. Q. Bui

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21934 2025-09-08 cs.CL 70%

Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad

Ivo Petrov, Jasper Dekoninck, Lyuben Baltadzhiev, Maria Drencheva, Kristian Minchev, Mislav Balunović, Nikola Jovanović, Martin Vechev

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00008 2025-09-08 cs.AI cs.CV cs.HC 57%

DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning

Hang Wu, Hongkai Chen, Yujun Cai, Chang Liu, Qingwen Ye, Ming-Hsuan Yang, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04834 2025-09-08 cs.CV 50%

TemporalFlowViz: Parameter-Aware Visual Analytics for Interpreting Scramjet Combustion Evolution

Yifei Jia, Shiyu Cheng, Yu Dong, Guan Li, Dong Tian, Ruixiao Peng, Xuyi Lu, Yu Wang, Wei Yao, Guihua Shan

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07923 2025-09-08 cs.CY cs.CC econ.GN q-fin.EC 50%

When and Why is Persuasion Hard? A Computational Complexity Result

Zachary Wojtowicz

专题命中 推理与问题求解 :foundation model(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 评测与基准 40 篇

2509.04504 2025-09-08 cs.CL cs.AI 90%

Behavioral Fingerprinting of Large Language Models

Zehua Pei, Hui-Ling Zhen, Ying Zhang, Zhiyuan Yang, Xing Li, Xianzhi Yu, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Submitted to 1st Open Conference on AI Agents for Science (agents4science 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03164 2025-09-08 cs.HC 89%

OPRA-Vis: Visual Analytics System to Assist Organization-Public Relationship Assessment with Large Language Models

Sangbong Yoo, Seongbum Seo, Chanyoung Yoon, Hyelim Lee, Jeong-Nam Kim, Chansoo Kim, Yun Jang, Takanori Fujiwara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00931 2025-09-08 cs.CL cs.AI 88%

Large Language Model-Driven Dynamic Assessment of Grammatical Accuracy in English Language Learner Writing

Timur Jaganov, John Blake, Julián Villegas, Nicholas Carr

机构 * National Institute of Standards(国家标准 institute) Department of Physics, Colorado State University(物理系,科罗拉多州立大学) Electrical Engineering Department, University of Colorado(电气工程系,科罗拉多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 8 Figures. This work has been submitted to the IEEE for possible publication

Journal ref IEEE ACCESS, 2025, Volume 13, pp. 151538-151550

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04866 2025-09-08 cs.CL 88%

Memorization $\neq$ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?

Boxiang Ma, Ru Li, Yuanlong Wang, Hongye Tan, Xiaoli Li

机构 * School of Computer and Information Technology, Shanxi University(山西大学计算机与信息学院) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04455 2025-09-08 cs.CL 88%

INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance

Shisong Chen, Qian Zhu, Wenyan Yang, Chengyi Yang, Zhong Wang, Ping Wang, Xuan Lin, Bo Xu, Daqian Li, Chao Yuan, Licai Qi, Wanqing Xu, sun zhenxing, Xin Lu, Shiqiang Xiong, Chao Chen, Haixiang Hu, Yanghua Xiao

机构 * Ant Group(蚂蚁集团) Fudan University(复旦大学) East China Normal University(东华大学) Donghua University(东华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04644 2025-09-08 cs.SE 88%

Comparative Evaluation of Large Language Models for Test-Skeleton Generation

Subhang Boorlagadda, Nitya Naga Sai Atluri, Muhammet Mustafa Olmez, Edward F. Gehringer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Forthcoming in Frontiers in Education (FIE 2025), Nashville, Tennessee, USA, Nov 2-5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05006 2025-09-08 cs.CL cs.LG 87%

Do Large Language Models Need Intent? Revisiting Response Generation Strategies for Service Assistant

Inbal Bolshinsky, Shani Kupiec, Almog Sasson, Yehudit Aperstein, Alexander Apartsin

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05528 2025-09-08 cs.AI cs.CL 86%

Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment

Jiahuan Pei, Fanghua Ye, Xin Sun, Wentao Deng, Koen Hindriks, Junxiao Wang

机构 * Vrije University of Amsterdam(阿姆斯特丹自由大学) University College London(伦敦大学学院) University of Amsterdam(阿姆斯特丹大学) National Institute of Informatics(日本信息处理学会) Shandong University(山东大学) Guangzhou University(广州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04469 2025-09-08 cs.CL cs.AI 86%

Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing

David Berghaus, Armin Berger, Lars Hillebrand, Kostadin Cvejoski, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Lamarr Institute(拉马尔研究所)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20541 2025-09-08 cs.AI 85%

MeLA: A Metacognitive LLM-Driven Architecture for Automatic Heuristic Design

Zishang Qiu, Xinan Chen, Long Chen, Ruibin Bai

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波分校计算机科学学院) College of Teacher Education, Zhejiang Normal University(浙江师范大学教师教育学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22809 2025-09-08 cs.CL cs.AI cs.HC 84%

First Steps Towards Overhearing LLM Agents: A Case Study With Dungeons & Dragons Gameplay

Andrew Zhu, Evan Osgood, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 5 figures. COLM 2025 Workshop on AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏