arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-07 至 2025-11-07 共收录 159 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 38 篇

2511.04328 2025-11-07 cs.AI 90%

RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation

Jiahao Zhao, Luxin Xu, Minghuan Tan, Lichao Zhang, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University of Advanced Technology(深圳大学) School of Biomedical Engineering, UNSW Sydney(生物医学工程学院,UNSW悉尼)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To appear in BIBM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04132 2025-11-07 cs.LG 89%

Exploring the Feasibility of End-to-End Large Language Model as a Compiler

Hongbin Zhang, Shihao Gao, Yang Liu, Mingjie Xing, Yanjun Wu, Chen Zhao

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments This work has been accepted by IJCNN 2025 and submitted to the IEEE for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21591 2025-11-07 cs.CL 89%

FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning

Shaoyu Dou, Yutian Shen, Mofan Chen, Zixuan Wang, Jiajie Xu, Qi Guo, Kailai Shao, Chao Chen, Haixiang Hu, Haibo Shi, Min Min, Liwen Zhang

机构 * Ant Group(蚂蚁集团) Shanghai University of Finance and Economics(上海金融学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by FinNLP@EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04267 2025-11-07 cs.SE 89%

A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18658 2025-11-07 cs.CL cs.AI cs.LG 89%

Robustness in Large Language Models: A Survey of Mitigation Strategies and Evaluation Metrics

Pankaj Kumar, Subhankar Mishra

机构 * School of Computer Sciences(计算机科学学院) National Institute of Science Education and Research(国家科学教育与研究 institute) An OCC of Homi Bhabha National Institute, India(霍米·巴布国家研究所办公室,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04012 2025-11-07 cs.SE 88%

PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models

Yongxi Chen, Lei Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04847 2025-11-07 cs.CL cs.AI 86%

Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards

Manveer Singh Tamber, Forrest Sheng Bao, Chenyu Xu, Ge Luo, Suleman Kazi, Minseok Bae, Miaoran Li, Ofer Mendelevitch, Renyi Qu, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Vectara(Vectara公司) Iowa State University(爱荷华州立大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP Industry Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04541 2025-11-07 cs.IR cs.AI 85%

LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems

Baptiste Bonin, Maxime Heuillet, Audrey Durand

机构 * Université Laval (IID)(拉瓦尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) CIFAR AI CHAIR(CIFAR人工智能主席)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04538 2025-11-07 cs.CL 85%

From Model to Breach: Towards Actionable LLM-Generated Vulnerabilities Reporting

Cyril Vallez, Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO Valais-Wallis(IEM,HES-SO瓦莱-达沃斯) II, HES-SO Valais-Wallis(II,HES-SO瓦莱-达沃斯) Cyber-Defence Campus, armasuisse(网络安全防御校区,armasuisse)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04316 2025-11-07 cs.AI cs.SE 85%

AdversariaLLM: A Unified and Modular Toolbox for LLM Robustness Research

Tim Beyer, Jonas Dornbusch, Jakob Steimle, Moritz Ladenburger, Leo Schwinn, Stephan Günnemann

机构 * Department of Computer Science, Technical University of Munich, Germany(慕尼黑技术大学计算机科学系) Munich Data Science Institute, Germany(慕尼黑数据科学研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04205 2025-11-07 cs.CL 85%

LLM-as-a-Judge is Bad, Based on AI Attempting the Exam Qualifying for the Member of the Polish National Board of Appeal

Michał Karp, Anna Kubaszewska, Magdalena Król, Robert Król, Aleksander Smywiński-Pohl, Mateusz Szymański, Witold Wydmański

机构 * Polish National Board of Appeal(波兰国家上诉委员会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04213 2025-11-07 stat.OT 85%

Can we trust LLMs as a tutor for our students? Evaluating the Quality of LLM-generated Feedback in Statistics Exams

Markus Herklotz, Niklas Ippisch, Anna-Carolina Haensch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09956 2025-11-07 cs.CL cs.AI cs.IR cs.LG 85%

KGGen: Extracting Knowledge Graphs from Plain Text with Language Models

Belinda Mo, Kyssen Yu, Joshua Kazdan, Joan Cabezas, Proud Mpala, Lisa Yu, Chris Cundy, Charilaos Kanatsoulis, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) FAR AI

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03980 2025-11-07 cs.AI cs.CL 82%

LLMs and Cultural Values: the Impact of Prompt Language and Explicit Cultural Framing

Bram Bulté, Ayla Rigouts Terryn

机构 * Brussels Centre for Language Studies, Vrije Universiteit Brussel(布鲁塞尔语言研究中心,布鲁塞尔自由大学) Université de Montréal & Mila - Quebec AI Institute(蒙特利尔大学及魁北克人工智能研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Preprint under review at Computational Linguistics. Accepted with minor revisions (10/10/2025); second round

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04288 2025-11-07 cs.CV 82%

Vision Foundation Models in Agriculture: Toward Domain-Specific Adaptation for Weed Herbicide Trials Assessment

Leire Benito-Del-Valle, Artzai Picón, Daniel Mugica, Manuel Ramos, Eva Portillo, Javier Romero, Carlos Javier Jimenez, Ramón Navarra-Mestre

机构 * TECNALIA, Basque Research and Technology Alliance(TECNALIA巴斯克研究与技术联盟) University of the Basque Country, Plaza Torres Quevedo(巴斯克国家大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03925 2025-11-07 cs.SE cs.AI 81%

Collaborative Agents for Automated Program Repair in Ruby

Nikta Akbarpour, Mahdieh Sadat Benis, Fatemeh Hendijani Fard, Ali Ouni, Mohamed Aymen Saied

机构 * University of British Columbia(不列颠哥伦比亚大学) Laval university(拉瓦尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04115 2025-11-07 cs.SE cs.PL 80%

How Natural Language Proficiency Shapes GenAI Code for Software Engineering Tasks

Ruksit Rojpaisarnkit, Youmei Fan, Kenichi Matsumoto, Raula Gaikovina Kula

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

Comments 7 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04502 2025-11-07 cs.CL cs.AI 79%

RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG

Joshua Gao, Quoc Huy Pham, Subin Varghese, Silwal Saurav, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯敦分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04064 2025-11-07 cs.SE 78%

Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development

Zhengran Zeng, Yixin Li, Rui Xie, Wei Ye, Shikun Zhang

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01409 2025-11-07 cs.CL 77%

LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge

Heng Zhou, Ao Yu, Yuchen Fan, Jianing Shi, Li Kang, Hejia Geng, Yongting Zhang, Yutao Fan, Yuhao Wu, Tiancheng He, Yiran Qin, Lei Bai, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) London School of Economics(伦敦经济学院) BUPT(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) SUTD(新加坡科技设计大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07325 2025-11-07 cs.LG 77%

CancerGUIDE: Cancer Guideline Understanding via Internal Disagreement Estimation

Alyssa Unell, Noel C. F. Codella, Sam Preston, Peniel Argaw, Wen-wai Yim, Zelalem Gero, Cliff Wong, Rajesh Jena, Eric Horvitz, Amanda K. Hall, Ruican Rachel Zhong, Jiachen Li, Shrey Jain, Mu Wei, Matthew Lungren, Hoifung Poon

机构 * Microsoft Research Stanford University(微软研究院斯坦福大学) Microsoft Health and Life Sciences Project Mentors(微软健康与生命科学项目导师) Microsoft Health and Life Sciences(微软健康与生命科学) Microsoft Research(微软研究院) Microsoft Research University of Washington(微软研究院华盛顿大学) Microsoft Health and Life Sciences Equal Leadership(微软健康与生命科学同等领导)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04032 2025-11-07 cs.AI 77%

Detecting Silent Failures in Multi-Agentic AI Trajectories

Divya Pathak, Harshit Kumar, Anuska Roy, Felix George, Mudit Verma, Pratibha Moogi

机构 * IBM Research(IBM研究院) IIIT Bangalore(班加罗尔IIIT)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03325 2025-11-07 cs.CV 75%

SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding

Mauro Orazio Drago, Luca Carlini, Pelinsu Celebi Balyemez, Dennis Pierantozzi, Chiara Lena, Cesare Hassan, Danail Stoyanov, Elena De Momi, Sophia Bano, Mobarak I. Hoque

机构 * Dipartimento di Elettronica, Informazione e Bioingegneria (DEIB)(电子、信息与生物工程系) Politecnico di Milano(米兰理工大学) IRCCS Humanitas Research Hospital(IRCCS人类itas研究医院) UCL Hawkes Institute and Department of Computer Science(UCL Hawkes研究所和计算机科学系) University College London(伦敦大学学院) University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01019 2025-11-07 cs.CL cs.AI cs.CE cs.LG physics.ao-ph 75%

OceanAI: A Conversational Platform for Accurate, Transparent, Near-Real-Time Oceanographic Insights

Bowen Chen, Jayesh Gajbhar, Gregory Dusek, Rob Redmon, Patrick Hogan, Paul Liu, DelWayne Bohnenstiehl, Dongkuan Xu, Ruoying He

机构 * North Carolina State University(北卡罗来纳州立大学) NOAA(国家海洋和大气管理局)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments A related presentation will be given at the AGU(American Geophysical Union) and AMS(American Meteorological Society) Annual Meetings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01183 2025-11-07 cs.DB 75%

TCSR-SQL: Towards Table Content-aware Text-to-SQL with Self-retrieval

Wenbo Xu, Liang Yan, Chuanyi Liu, Peiyi Han, Haifeng Zhu, Yong Xu, Yingwei Liang, Bob Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 13 pages, 13 figures, accepted by CAAI Transactions on Intelligence Technology, doi: http://doi.org/10.1049/cit2.70071

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03757 2025-11-07 cs.LG cs.AI 73%

Laugh, Relate, Engage: Stylized Comment Generation for Short Videos

Xuan Ouyang, Senan Wang, Bouzhou Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04533 2025-11-07 eess.AS 71%

CardioPHON: Quality assessment and self-supervised pretraining for screening of cardiac function based on phonocardiogram recordings

Vladimir Despotovic, Peter Pocta, Andrej Zgank

专题命中 评测与基准 :pretraining(title)

Journal ref Biomedical Signal Processing and Control 113 (2026) 109047

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13956 2025-11-07 cs.AI cs.CV cs.MM 70%

Cross-modal Causal Intervention for Alzheimer's Disease Prediction

Yutao Jin, Haowen Xiao, Junyong Zhai, Yuxiao Li, Jielei Chu, Fengmao Lv, Yuxiao Li

机构 * Southwest Jiaotong University(西南交通大学) Southeast University(东南大学) Sichuan University(四川大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12474 2025-11-07 cs.CL 70%

What Are They Talking About? A Benchmark of Knowledge-Grounded Discussion Summarization

Weixiao Zhou, Junnan Zhu, Gengyao Li, Xianfu Cheng, Xinnian Liang, Feifei Zhai, Zhoujun Li

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to AACL-IJCNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07110 2025-11-07 cs.IR cs.LG 70%

DashCLIP: Leveraging multimodal models for generating semantic embeddings for DoorDash

Omkar Gurjar, Kin Sum Liu, Praveen Kolli, Utsaw Kumar, Mandar Rahurkar

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏