arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-24 至 2025-09-24 共收录 202 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2507.03616 2025-09-24 cs.AI 70%

EvoAgentX: An Automated Framework for Evolving Agentic Workflows

Yingxu Wang, Siwei Liu, Jinyuan Fang, Zaiqiao Meng

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) University of Aberdeen(阿伯丁大学) University of Glasgow(格拉斯哥大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16216 2025-09-24 cs.CL 70%

Memorization or Reasoning? Exploring the Idiom Understanding of LLMs

Jisu Kim, Youngwoo Shin, Uiji Hwang, Jihun Choi, Richeng Xuan, Taeuk Kim

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21074 2025-09-24 cs.CL 70%

CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation

Zhenyi Shen, Hanqi Yan, Linhai Zhang, Zhanghao Hu, Yali Du, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 17 pages. Code available at https://github.com/zhenyi4/codi

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20097 2025-09-24 cs.AI cs.HC q-bio.NC 70%

ITCMA: A Generative Agent Based on a Computational Consciousness Structure

Hanzhong Zhang, Jibin Yin, Haoyang Wang, Ziwei Xiang

机构 * Kunming University of Science and Technology(昆明理工大学) Huaqiao University(华侨大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages, 11 figures

Journal ref Applied Soft Computing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18604 2025-09-24 cond-mat.mtrl-sci 67%

A closed-loop AI framework for hypothesis-driven and interpretable materials design

Kangyu Ji, Tianran Liu, Fang Sheng, Shaun Tan, Moungi Bawendi, Tonio Buonassisi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18571 2025-09-24 cs.CV 67%

Live-E2T: Real-time Threat Monitoring in Video via Deduplicated Event Reasoning and Chain-of-Thought

Yuhan Wang, Cheng Liu, Zihan Zhao, Weichao Wu

机构 * School of Mechatronical Engineering, Beijing Institute of Technology(机械工程学院,北京理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17537 2025-09-24 cs.CV 67%

SimToken: A Simple Baseline for Referring Audio-Visual Segmentation

Dian Jin, Yanghao Zhou, Jinxing Zhou, Jiaqi Ma, Ruohao Guo, Dan Guo

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments Project page: https://github.com/DianJin-HFUT/SimToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18592 2025-09-24 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation

Neel P. Bhatt, Yunhao Yang, Rohan Siva, Pranay Samineni, Daniel Milan, Zhangyang Wang, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments Codebase, datasets, and videos for VLN-Zero are available at: https://vln-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18282 2025-09-24 cs.RO cs.AI cs.LG 62%

PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies

Jesse Zhang, Marius Memmel, Kevin Kim, Dieter Fox, Jesse Thomason, Fabio Ramos, Erdem Bıyık, Abhishek Gupta, Anqi Li

机构 * University of Washington(华盛顿大学) NVIDIA(NVIDIA公司) University of Southern California(南加州大学) Allen Institute for AI(人工智能研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18382 2025-09-24 cs.AI 57%

Evaluating the Safety and Skill Reasoning of Large Reasoning Models Under Compute Constraints

Adarsha Balaji, Le Chen, Rajeev Thakur, Franck Cappello, Sandeep Madireddy

机构 * Argonne National Laboratory(阿贡国家实验室) Mathematics and Computer Science Division(数学与计算机科学 division) Data Science and Learning Division(数据科学与学习 division)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18425 2025-09-24 cs.CV 50%

Losing the Plot: How VLM responses degrade on imperfect charts

Philip Wootaek Shin, Jack Sampson, Vijaykrishnan Narayanan, Andres Marquez, Mahantesh Halappanavar

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 56 篇

2503.05613 2025-09-24 cs.LG cs.AI cs.CL 90%

A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models

Dong Shu, Xuansheng Wu, Haiyan Zhao, Daking Rai, Ziyu Yao, Ninghao Liu, Mengnan Du

机构 * Northwestern University(西北大学) University of Georgia(佐治亚大学) New Jersey Institute of Technology(新泽西理工学院) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18862 2025-09-24 cs.CL 89%

Multi-Hierarchical Feature Detection for Large Language Model Generated Text

Luyan Zhang, Xinyu Xie

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 9 pages, 6 tables, empirical study on multi-feature AI text detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18446 2025-09-24 cs.CY cs.LG 89%

Large-Scale, Longitudinal Study of Large Language Models During the 2024 US Election Season

Sarah H. Cen, Andrew Ilyas, Hedi Driss, Charlotte Park, Aspen Hopkins, Chara Podimata, Aleksander Mądry

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 100 pages, 69 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20197 2025-09-24 cs.SE 89%

A Preliminary Study on the Robustness of Code Generation by Large Language Models

Zike Li, Mingwei Liu, Anji Li, Kaifeng He, Yanlin Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12613 2025-09-24 cs.CL cs.AI cs.CV cs.LG cs.MA 89%

Exploring Model Kinship for Merging Large Language Models

Yedi Hu, Yunzhi Yao, Ningyu Zhang, Huajun Chen, Shumin Deng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) NUS-NCS Joint Lab(新加坡国立大学NCS联合实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18173 2025-09-24 cs.LG cs.CL 88%

TurnBack: A Geospatial Route Cognition Benchmark for Large Language Models through Reverse Route

Hongyi Luo, Qing Cheng, Daniel Matos, Hari Krishna Gadi, Yanfeng Zhang, Lu Liu, Yongliang Wang, Niclas Zeller, Daniel Cremers, Liqiu Meng

机构 * Huawei Riemann Lab(华为里emann实验室) Technische Universität München(技术大学慕尼黑) Hochschule Karlsruhe(卡尔斯鲁厄应用科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025 (Main). This is the camera-ready/author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19191 2025-09-24 q-bio.BM cs.AI cs.LG 88%

Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models

Haonan He, Yuchen Ren, Yining Tang, Ziyang Xu, Junxian Li, Minghao Yang, Di Zhang, Dong Yuan, Tao Chen, Shufei Zhang, Yuqiang Li, Nanqing Dong, Wanli Ouyang, Dongzhan Zhou, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) University of Sydney(悉尼大学) University of Toronto(多伦多大学) Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18792 2025-09-24 cs.CL 88%

Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing

Sabri Boughorbel, Fahim Dalvi, Nadir Durrani, Majd Hawasly

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈瓦那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 12 pages, accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18690 2025-09-24 cs.AI 88%

Advances in Large Language Models for Medicine

Zhiyu Kan, Wensheng Gan, Zhenlian Qi, Philip S. Yu

机构 * Jinan University(济南大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Preprint. 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18420 2025-09-24 cs.AI 88%

Instruction-Following Evaluation in Function Calling for Large Language Models

Nikolai Skripko

机构 * Higher School of Economics(俄罗斯高等经济学院) SberDevices

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11101 2025-09-24 cs.CL 88%

Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学工业技术研究所) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments I need to modify the content of the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13707 2025-09-24 cs.CV cs.AI 88%

EventVL: Understand Event Streams via Multimodal Large Language Model

Pengteng Li, Yunfan Lu, Pinghao Song, Wuyang Li, Huizai Yao, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) KU Leuven(根特大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Carleton University(卡尔顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18846 2025-09-24 cs.AI 87%

Model selection meets clinical semantics: Optimizing ICD-10-CM prediction via LLM-as-Judge evaluation, redundancy-aware sampling, and section-aware fine-tuning

Hong-Jie Dai, Zheng-Hao Li, An-Tai Lu, Bo-Tsz Shain, Ming-Ta Li, Tatheer Hussain Mir, Kuang-Te Wang, Min-I Su, Pei-Kang Liu, Ming-Ju Tsai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 28 Pages, 4 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17628 2025-09-24 cs.CL cs.AI 86%

MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents

Yuzhen Lei, Hongbin Xie, Jiaxing Zhao, Shuangxue Liu, Xuan Song

机构 * Jilin University(吉林大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18370 2025-09-24 cs.SE cs.CL cs.CR cs.LG 86%

Training Language Model Agents to Find Vulnerabilities with CTF-Dojo

Terry Yue Zhuo, Dingmin Wang, Hantian Ding, Varun Kumar, Zijian Wang

机构 * Monash University(墨尔本大学) AWS AI Labs(亚马逊AI实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18658 2025-09-24 cs.CL 86%

Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction

Huanxin Sheng, Xinyi Liu, Hangfeng He, Jieyu Zhao, Jian Kang

机构 * University of Rochester(罗切斯特大学) University of Southern California(南加州大学) MBZUAI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments To appear in EMNLP 2025. Our code and data are available at \url{https://github.com/BruceSheng1202/Analyzing_Uncertainty_of_LLM-as-a-Judge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13978 2025-09-24 cs.DC cs.AI cs.DB 86%

LLM Agents for Interactive Workflow Provenance: Reference Architecture and Evaluation Methodology

Renan Souza, Timothy Poteet, Brian Etz, Daniel Rosendo, Amal Gueroudji, Woong Shin, Prasanna Balaprakash, Rafael Ferreira da Silva

机构 * Oak Ridge National Lab.(橡树岭国家实验室) Argonne National Lab.(阿贡国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Paper accepted in the proceedings of the Supercomputing Conference (SC). Cite it as Renan Souza, Timothy Poteet, Brian Etz, Daniel Rosendo, Amal Gueroudji, Woong Shin, Prasanna Balaprakash, and Rafael Ferreira da Silva. LLM Agents for Interactive Workflow Provenance: Reference Architecture and Evaluation Methodology. In WORKS at the ACM/IEEE International Conference on Supercomputing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19117 2025-09-24 cs.CR cs.LG cs.SE 85%

LLM-based Vulnerability Discovery through the Lens of Code Metrics

Felix Weissberg, Lukas Pirch, Erik Imgrund, Jonas Möller, Thorsten Eisenhofer, Konrad Rieck

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18575 2025-09-24 cs.IR cs.AI 85%

The Ranking Blind Spot: Decision Hijacking in LLM-based Text Ranking

Yaoyao Qian, Yifan Zeng, Yuchao Jiang, Chelsi Jain, Huazheng Wang

机构 * Northeastern University(东北大学) Oregon State University(俄勒冈州立大学) University of Macau(澳门大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏