arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-19 至 2025-11-19 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2511.10819 2025-11-19 cs.CL 92%

LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation

Grace Byun, Swati Rajwal, Jinho D. Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14101 2025-11-19 cs.AI 89%

APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page Design

Xinpeng Chen, Xiaofeng Han, Kaihao Zhang, Guochao Ren, Yujie Wang, Wenhao Cao, Yang Zhou, Jianfeng Lu, Zhenbo Song

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Huatai Securities Co., Ltd.(华泰证券有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13801 2025-11-19 cs.DL cs.CL 89%

Rdgai: Classifying transcriptional changes using Large Language Models with a test case from an Arabic Gospel tradition

Robert Turnbull

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15925 2025-11-19 cs.CV cs.AI 89%

MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection

Andrea Moglia, Elia Clement Nastasio, Luca Mainardi, Pietro Cerveri

机构 * Department of Electronics, Information, and Bioengineering(电子、信息与生物工程系) Polytechnic University of Milan(米兰理工学院) Department of Industrial, and Information Engineering(工业与信息工程系) University of Pavia(帕维亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Journal ref Moglia, A., Nastasio, E.C., Mainardi, L. et al. MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Observation and Localization in CT Images. J Healthc Inform Res (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14606 2025-11-19 cs.CL cs.LG 88%

Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News Media Using Large Language Models

Shreya Adrita Banik, Niaz Nafi Rahman, Tahsina Moiukh, Farig Sadeque

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11777 2025-11-19 cs.RO cs.CV 88%

Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy

Vinit Mehta, Charu Sharma, Karthick Thiyagarajan

机构 * Machine Learning Lab IIIT Hyderabad(IIIT Hyderabad 机器学习实验室) SensR Lab Western Sydney University(Western Sydney University SensR实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 45 pages, 15 figures, MDPI Sensors Journal

Journal ref Sensors 2025, 25(20), 6394

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2025-11-19 cs.CV cs.AI cs.CL 87%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13907 2025-11-19 cs.DB 87%

SQL-to-Text Generation with Weighted-AST Few-Shot Prompting

Sriom Chakrabarti, Chuangtao Ma, Arijit Khan, Sebastian Link

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15902 2025-11-19 cs.LG cs.AI cs.CL 87%

IPAD: Inverse Prompt for AI Detection - A Robust and Interpretable LLM-Generated Text Detector

Zheng Chen, Yushi Feng, Jisheng Dang, Yue Deng, Changyang He, Hongxi Pu, Haoxuan Li, Bo Li

机构 * Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算机科学与数据科学学院) School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院) Max Planck Institute for Security and Privacy(安全与隐私研究所) Computer Science, The University of Michigan(密歇根大学计算机科学系) Center for Data Science, Peking University(北京大学数据科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21359 2025-11-19 cs.CL cs.AI cs.CY cs.LG econ.GN q-fin.EC 87%

Can Machines Think Like Humans? A Behavioral Evaluation of LLM Agents in Dictator Games

Ji Ma

机构 * Gradel Institute of Charity, New College, University of Oxford(格拉德学院,牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14248 2025-11-19 cs.AI 85%

Enhancing Regional Airbnb Trend Forecasting Using LLM-Based Embeddings of Accessibility and Human Mobility

Hongju Lee, Youngjun Park, Jisun An, Dongman Lee

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) School of Computing, KAIST(韩国科学技术院计算机科学学院) Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校信息学、计算与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at ASONAM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14181 2025-11-19 cs.CL 85%

Harnessing Deep LLM Participation for Robust Entity Linking

Jiajun Hou, Chenyu Zhang, Rui Meng

机构 * Guangdong Provincial/Zhuhai Key Laboratory of IRADS(广东省级/珠海IRADS关键实验室) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 85%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18970 2025-11-19 cs.AI 85%

LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions

Xixun Lin, Yucheng Ning, Jingwen Zhang, Yan Dong, Yilong Liu, Yongxuan Wu, Xiaohua Qi, Nan Sun, Yanmin Shang, Kun Wang, Pengfei Cao, Qingyue Wang, Lixin Zou, Xu Chen, Chuan Zhou, Jia Wu, Peng Zhang, Qingsong Wen, Shirui Pan, Bin Wang, Yanan Cao, Kai Chen, Songlin Hu, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Computing, Faculty of Science and Engineering, Macquarie University(麦考瑞大学计算机学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学高级技术网络研究所) Squirrel Ai Learning Xiaomi Company(小米公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14359 2025-11-19 cs.HC cs.SE 85%

Towards LLM-Based Usability Analysis for Recommender User Interfaces

Sebastian Lubos, Alexander Felfernig, Damian Garber, Viet-Man Le, Thi Ngoc Trang Tran

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments The paper was presented at IntRS'25: Joint Workshop on Interfaces and Human Decision Making for Recommender Systems, September 22, 2025, Prague, Czech Republic and is published in the workshop proceedings: https://ceur-ws.org/Vol-4027/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14140 2025-11-19 cs.CR 85%

Beyond Fixed and Dynamic Prompts: Embedded Jailbreak Templates for Advancing LLM Security

Hajun Kim, Hyunsik Na, Daeseon Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09148 2025-11-19 cs.CL cs.AI cs.LG 85%

LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls

Kangning Zhang, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The code is accessible at https://github.com/Rednote-DeepExperience/LoopTool. The LoopTool-8B is accessible at https://huggingface.co/zhuiguang-ning/LoopTool-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02373 2025-11-19 cs.CV 82%

UVLM: Benchmarking Video Language Model for Underwater World Understanding

Xizhe Xue, Yang Zhou, Dawei Yan, Lijie Tao, Junjie Li, Ying Li, Haokui Zhang, Rong Xiao

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

Comments 18 pages, 10 figures, 7 tables. Accepted to the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14129 2025-11-19 cs.CR cs.LG 79%

MalRAG: A Retrieval-Augmented LLM Framework for Open-set Malicious Traffic Identification

Xiang Luo, Chang Liu, Gang Xiong, Chen Yang, Gaopeng Gou, Yaochen Ren, Zhen Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments 13 pages, 13 figures. Intended for submission to IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14023 2025-11-19 cs.AI 79%

Syn-STARTS: Synthesized START Triage Scenario Generation Framework for Scalable LLM Evaluation

Chiharu Hagiwara, Naoki Nonaka, Yuhta Hashimoto, Ryu Uchimido, Jun Seita

机构 * RIKEN Center for Integrative Medical Sciences(日本理化学研究所整合医学研究中心) RIKEN Tokyo Japan(日本理化学研究所东京日本) RIKEN Center for Interdisciplinary Theoretical and Mathematical Sciences(日本理化学研究所跨学科理论与数学科学中心) Faculty of Medicine Institute of Science Tokyo Tokyo Japan(医学系科学研究所东京东京日本)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments Introducing an open dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20338 2025-11-19 cs.CL cs.AI 79%

Assessing the Capability of LLMs in Solving POSCOMP Questions

Cayo Viegas, Rohit Gheyi, Márcio Ribeiro

机构 * UFCG(乌弗拉联邦大学) UFAL(阿拉戈斯联邦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14002 2025-11-19 cs.SE cs.AI cs.LG cs.PL 79%

FlakyGuard: Automatically Fixing Flaky Tests at Industry Scale

Chengpeng Li, Farnaz Behrang, August Shi, Peng Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步技术)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments To appear in ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13900 2025-11-19 cs.CL cs.AI 79%

What Works for 'Lost-in-the-Middle' in LLMs? A Study on GM-Extract and Mitigations

Mihir Gupte, Eshan Dixit, Muhammad Tayyab, Arun Adiththan

机构 * General Motors(通用汽车)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To be submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04418 2025-11-19 cs.SE 78%

Characterizing Multi-Hunk Patches: Divergence, Proximity, and LLM Repair Challenges

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10240 2025-11-19 cs.AR cs.LG 77%

Graph Neural Networks Based Analog Circuit Link Prediction

Guanyuan Pan, Tiansheng Zhou, Jianxiang Zhao, Zhi Li, Yugui Lin, Bingtao Ma, Yaqi Wang, Pietro Liò, Shuai Wang

机构 * HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学信息处理联合研究所) Intelligent Information Processing Laboratory, Hangzhou Dianzi University(杭州电子科技大学智能信息处理实验室) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(杭州电子科技大学电子设计自动化技术创新中心) School of Computer Science and Technology, South China Business College, Guangdong University of Foreign Studies(广东外语外贸大学南方商学院计算机科学与技术学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Code and data will be made available on request to the corresponding author

Journal ref Pan, G., Zhou, T., Zhao, J., Li, Z., Lin, Y., Ma, B., ... & Wang, S. (2026). Graph Neural Networks Based Analog Circuit Link Prediction. Engineering Applications of Artificial Intelligence, 163, 113035

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11858 2025-11-19 cs.CL 77%

OpeNLGauge: An Explainable Metric for NLG Evaluation with Open-Weights LLMs

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments INLG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14062 2025-11-19 cs.SE cs.LG 77%

LogPurge: Log Data Purification for Anomaly Detection via Rule-Enhanced Filtering

Shenglin Zhang, Ziang Chen, Zijing Que, Yilun Liu, Yongqian Sun, Sicheng Wei, Dan Pei, Hailin Li

机构 * Nankai University(南开大学) Huawei(华为) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16194 2025-11-19 cs.AI 77%

Towards Automatic Evaluation and Selection of PHI De-identification Models via Multi-Agent Collaboration

Guanchen Wu, Zuhui Chen, Yuzhang Xie, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Statistics, Columbia University(哥伦比亚大学统计系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Agents4Science 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17153 2025-11-19 cs.SE 75%

UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging

Cheryl Lee, Chunqiu Steven Xia, Longji Yang, Jen-tse Huang, Zhouruixin Zhu, Lingming Zhang, Michael R. Lyu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by EMNLP'25, Main Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14249 2025-11-19 cs.CL 70%

Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction Learning

Rui Liu, Yuan Zhao, Zhenqi Jia

机构 * Rui Liu \equalcontrib , Yuan Zhao \equalcontrib , Zhenqi Jia(Rui Liu、Yuan Zhao、Zhenqi Jia)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏