arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-05 至 2025-09-05 共收录 137 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19 篇

2509.04077 2025-09-05 cs.CL 79%

Improving Narrative Classification and Explanation via Fine Tuned Language Models

Rishit Tyagi, Rahul Bouri, Mohit Gupta

专题命中 推理与问题求解 :language model(title);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01747 2025-09-05 cs.CL 79%

DynaSaur: Large Language Agents Beyond Predefined Actions

Dang Nguyen, Viet Dac Lai, Seunghyun Yoon, Ryan A. Rossi, Handong Zhao, Ruiyi Zhang, Puneet Mathur, Nedim Lipka, Yu Wang, Trung Bui, Franck Dernoncourt, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Adobe Research(Adobe研究院)

专题命中 推理与问题求解 :language agent(title);LLM(abstract);分类 cs.CL

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04083 2025-09-05 cs.AI 77%

Intermediate Languages Matter: Formal Languages and LLMs affect Neurosymbolic Reasoning

Alexander Beiser, David Penz, Nysret Musliu

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments To appear in the proceedings of The Second Workshop on Knowledge Graphs and Neurosymbolic AI (KG-NeSy) Co-located with SEMANTiCS 2025 Conference, Vienna, Austria - September 3rd, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18201 2025-09-05 cs.CL cs.CV cs.HC 77%

Deciphering Emotions in Children Storybooks: A Comparative Analysis of Multimodal LLMs in Educational Applications

Bushra Asseri, Estabraq Abdelaziz, Maha Al Mogren, Tayef Alhefdhi, Areej Al-Wabil

机构 * College of Engineering & Advanced Computing(工程与高级计算学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03875 2025-09-05 cs.SE 75%

VulRTex: A Reasoning-Guided Approach to Identify Vulnerabilities from Rich-Text Issue Report

Ziyou Jiang, Mingyang Li, Guowei Yang, Lin Shi, Qing Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 25 pages, 7 figures, submitting to TOSEM journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12736 2025-09-05 cs.CL cs.AI cs.LG cs.SY eess.SY math.OC 75%

ACING: Actor-Critic for Instruction Learning in Black-Box LLMs

Salma Kharrat, Fares Fourati, Marco Canini

机构 * KAUST(卡斯土尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03644 2025-09-05 cs.AI cs.CL 73%

Towards a Neurosymbolic Reasoning System Grounded in Schematic Representations

François Olivier, Zied Bouraoui

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To appear in Proceedings of Machine Learning Research, 19th Conference on Neurosymbolic Learning and Reasoning, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16117 2025-09-05 cs.AI cs.CL cs.IR 73%

Extending FKG.in: Towards a Food Claim Traceability Network

Saransh Kumar Gupta, Rizwan Gulzar Mir, Lipika Dey, Partha Pratim Das, Anirban Sen, Ramesh Jain

机构 * Ashoka University(阿什瓦克大学) UCI Institute for Future Health(加州未来健康研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, 1 table, 45 references, ACM International Conference on Multimedia 2025 - Multi-modal Food Computing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01115 2025-09-05 cs.LG cs.CL 73%

Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer

Yihe Dong, Lorenzo Noci, Mikhail Khodak, Mufan Li

机构 * Princeton University(普林斯顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14585 2025-09-05 cs.CL 70%

Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning

Wenbin Hu, Haoran Li, Huihao Jing, Qi Hu, Ziqian Zeng, Sirui Han, Heli Xu, Tianshu Chu, Peizhao Hu, Yangqiu Song

机构 * HKUST(香港科技大学) South China University of Technology(华南理工大学) Huawei Technologies(华为技术有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03805 2025-09-05 cs.CL cs.AI 62%

Measuring How (Not Just Whether) VLMs Build Common Ground

Saki Imai, Mert İnan, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12065 2025-09-05 cs.CL cs.FL 57%

Autoformalization in the Wild: Assessing LLMs on Real-World Mathematical Definitions

Lan Zhang, Marco Valentino, Andre Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究机构) National Biomarker Centre, CRUK Manchester Institute(国家生物标志物中心、CRUK曼彻斯特研究所)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 41 篇

2508.15478 2025-09-05 cs.CL cs.CY cs.PF 92%

SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version

Nghiem Thanh Pham, Tung Kieu, Duc-Manh Nguyen, Son Ha Xuan, Nghia Duong-Trung, Danh Le-Phuoc

机构 * FPT University(FPT大学) Aalborg University(奥尔堡大学) Technische Universität Berlin(柏林技术大学) RMIT University(皇家理工大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) HiveIntel GmbH(HiveIntel公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(title,abstract);分类 cs.CL

Comments 24 pages. An extended version of "SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts" accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01185 2025-09-05 cs.CL cs.AI 89%

Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation

Seganrasan Subramanian, Abhigya Verma

机构 * ServiceNow

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);SFT(abstract);preference optimization(abstract)

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01359 2025-09-05 cs.CL cs.SE 88%

R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models

Ken Deng, Jiaheng Liu, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04007 2025-09-05 cs.AI 85%

AutoPBO: LLM-powered Optimization for Local Search PBO Solvers

Jinyuan Li, Yi Chu, Yiwen Sun, Mengchuan Zou, Shaowei Cai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03312 2025-09-05 cs.CL cs.MA 85%

AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?

Guibin Zhang, Junhao Wang, Junjie Chen, Wangchunshu Zhou, Kun Wang, Shuicheng Yan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09002 2025-09-05 cs.SE cs.AI cs.CR cs.OS 85%

KNighter: Transforming Static Analysis with LLM-Synthesized Checkers

Chenyuan Yang, Zijie Zhao, Zichen Xie, Haoyu Li, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05982 2025-09-05 cs.CL 85%

HamRaz: A Culture-Based Persian Conversation Dataset for Person-Centered Therapy Using LLM Agents

Mohammad Amin Abbasi, Farnaz Sadat Mirnezami, Ali Neshati, Hassan Naderi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04198 2025-09-05 cs.CY cs.MA 85%

Are LLM Agents the New RPA? A Comparative Study with RPA Across Enterprise Workflows

Petr Průcha, Michaela Matoušková, Jan Strnad

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01085 2025-09-05 cs.LG cs.CL 84%

Explaining Length Bias in LLM-Based Preference Evaluations

Zhengyu Hu, Linxin Song, Jieyu Zhang, Zheyuan Xiao, Tianfu Wang, Zhengyu Chen, Nicholas Jing Yuan, Jianxun Lian, Kaize Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou), China(人工智能前沿技术部,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学) University of Southern California(南加州大学) University of Washington(华盛顿大学) MeiTuan(美团) Microsoft(微软) Resideo(Resideo公司) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04191 2025-09-05 cs.CR cs.LG 83%

KubeGuard: LLM-Assisted Kubernetes Hardening via Configuration Files and Runtime Logs Analysis

Omri Sgan Cohen, Ehud Malul, Yair Meidan, Dudu Mimran, Yuval Elovici, Asaf Shabtai

机构 * Department of Software and Information Systems Engineering(软件与信息系统工程系) Ben-Gurion University of The Negev(贝内杰尔大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03800 2025-09-05 cs.CV 82%

MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting

Yuheng Li, Yenho Chen, Yuxiang Lai, Jike Zhong, Vanessa Wildman, Xiaofeng Yang

机构 * Department of Biomedical Engineering(生物医学工程系) Georgia Institute of Technology(佐治亚理工学院) Department of Machine Learning(机器学习系) Department of Radiation Oncology(放射肿瘤科) Emory University School of Medicine(埃默里大学医学院) University of Southern California(南加州大学)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04292 2025-09-05 cs.CL 81%

Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?

Qinyan Zhang, Xinping Lei, Ruijie Miao, Yu Fu, Haojie Fan, Le Chang, Jiafan Hou, Dingling Zhang, Zhongfei Hou, Ziqiang Yang, Changxin Pu, Fei Hu, Jingkai Liu, Mengyun Liu, Yang Liu, Xiang Gao, Jiaheng Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed(字节跳动种子) Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04213 2025-09-05 eess.SY cs.LG cs.SY 79%

Sailing Towards Zero-Shot State Estimation using Foundation Models Combined with a UKF

Tobin Holtmann, David Stenger, Andres Posada-Moreno, Friedrich Solowjow, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛RWTH大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments Accepted for publication at CDC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04013 2025-09-05 cs.CL cs.AI 79%

On Robustness and Reliability of Benchmark-Based Evaluation of LLMs

Riccardo Lunardi, Vincenzo Della Mea, Stefano Mizzaro, Kevin Roitero

机构 * University of Udine, Italy(乌迪内大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03940 2025-09-05 cs.CL cs.AI cs.SD 79%

VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents

Weihao Wu, Liang Cao, Xinyu Wu, Zhiwei Lin, Rui Niu, Jingbei Li, Zhiyong Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03809 2025-09-05 cs.CL cs.AI 79%

Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation

Jiaxin Guo, Daimeng Wei, Yuanchang Luo, Xiaoyu Chen, Zhanglin Wu, Huan Yang, Hengchao Shang, Zongyao Li, Zhiqiang Rao, Jinlong Yang, Hao Yang

机构 * Huawei Translation Services Center(华为翻译服务中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments under preview

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10823 2025-09-05 cs.CV eess.IV 78%

From Embeddings to Accuracy: Comparing Foundation Models for Radiographic Classification

Xue Li, Jameson Merkow, Noel C. F. Codella, Alberto Santamaria-Pang, Naiteek Sangani, Alexander Ersoy, Christopher Burt, John W. Garrett, Richard J. Bruce, Joshua D. Warner, Tyler Bradshaw, Ivan Tarapov, Matthew P. Lungren, Alan B. McMillan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Health and Life Sciences(微软健康与生命科学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13392 2025-09-05 cs.CV cs.HC 78%

POET: Supporting Prompting Creativity and Personalization with Automated Expansion of Text-to-Image Generation

Evans Xu Han, Alice Qian Zhang, Haiyi Zhu, Hong Shen, Paul Pu Liang, Jane Hsieh

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏