arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-05 至 2025-11-05 共收录 155 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 42 篇

2412.00621 2025-11-05 cs.CR cs.AI cs.CY cs.SI 85%

Exposing LLM Vulnerabilities: Adversarial Scam Detection and Performance

Chen-Wei Chang, Shailik Sarkar, Shutonu Mitra, Qi Zhang, Hossein Salemi, Hemant Purohit, Fengxiu Zhang, Michin Hong, Jin-Hee Cho, Chang-Tien Lu

机构 * Department of Computer Science, Virginia Tech, USA(维吉尼亚理工学院计算机科学系) Department of Information Sciences(信息科学系) School of Policy and Government, George Mason University, USA(乔治·马歇尔大学政策与政府学院) School of Social Work, Indiana University, USA(印第安纳大学社会工作学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 4 pages, 2024 IEEE International Conference on Big Data workshop BigEACPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02223 2025-11-05 physics.med-ph 85%

Quantitative Risk Assessment in Radiation Oncology via LLM-Powered Root Cause Analysis of Incident Reports

Yuntao Wang, Siamak P. Najad-Davarani, Elizabeth Bossart, Matthew T. Studenski, Mariluz De Ornelas, Yunze Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04633 2025-11-05 cs.NE cs.AI cs.LG q-bio.NC 84%

The Physical Basis of Prediction: World Model Formation in Neural Organoids via an LLM-Generated Curriculum

Brennen Hill

机构 * Department of Computer Science University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Published in the proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Scaling Environments for Agents (SEA). Additionally accepted for presentation in NeurIPS 2025 Workshop: Embodied World Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02713 2025-11-05 cs.SE 82%

ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation

Qianru Meng, Zhaochun Ren, Joost Visser

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01915 2025-11-05 cs.CV eess.IV 82%

Challenging DINOv3 Foundation Model under Low Inter-Class Variability: A Case Study on Fetal Brain Ultrasound

Edoardo Conti, Riccardo Rosati, Lorenzo Federici, Adriano Mancini, Maria Chiara Fiorentin

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01854 2025-11-05 cs.CL 79%

Tool-to-Agent Retrieval: Bridging Tools and Agents for Scalable LLM Multi-Agent Systems

Elias Lumer, Faheem Nizar, Anmol Gulati, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers U.S.A.(普华永道美国公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26205 2025-11-05 cs.CL cs.AI 79%

Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning

Qi Luo, Xiaonan Li, Tingshuo Fan, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15112 2025-11-05 cs.CR 78%

AndroByte: LLM-Driven Privacy Analysis through Bytecode Summarization and Dynamic Dataflow Call Graph Generation

Mst Eshita Khatun, Lamine Noureddine, Zhiyong Sui, Aisha Ali-Gombe

专题命中 评测与基准 :LLM(title,abstract)

Comments Accepted at the Annual Computer Security Applications Conference (ACSAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02794 2025-11-05 cs.AI cs.MA 77%

When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning

Chenyu Zhang, Minsol Kim, Shohreh Ghorbani, Jingyao Wu, Rosalind Picard, Patricia Maes, Paul Pu Liang

机构 * Harvard University(哈佛大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

Comments Accepted at the Multimodal Algorithmic Reasoning (MAR) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01183 2025-11-05 cs.AI cs.PL 77%

QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code

Hainan Fang, Yuanbo Wen, Jun Bi, Yihan Wang, Tonghui He, Yanlin Tang, Di Huang, Jiaming Guo, Rui Zhang, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所处理器重点实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07453 2025-11-05 cs.AI 77%

How well do LLMs reason over tabular data, really?

Cornelius Wolff, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(数学与信息学研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 4 figures

Journal ref The 4th Table Representation Learning Workshop at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01907 2025-11-05 cs.CY cs.AI cs.HC 77%

Between Myths and Metaphors: Rethinking LLMs for SRH in Conservative Contexts

Ameemah Humayun, Bushra Zubair, Maryam Mustafa

机构 * Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21080 2025-11-05 cs.CL 77%

EmoDebt: Bayesian-Optimized Emotional Intelligence for Strategic Agent-to-Agent Debt Recovery

Yunbo Long, Yuhan Liu, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16392 2025-11-05 cs.CL cs.LG 76%

Scaffolded Language Models with Language Supervision for Mixed-Autonomy: A Survey

Matthieu Lin, Jenny Sheng, Andrew Zhao, Shenzhi Wang, Yang Yue, Victor Shea Jay Huang, Huan Liu, Jun Liu, Gao Huang, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Department of Automation, Tsinghua University, Beijing, China(自动化系,清华大学,北京,中国) Shanghai AI Lab, Shanghai, China(上海人工智能实验室,上海,中国) Xi'an Jiaotong University, Xi'an, China(西安交通大学,西安,中国)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02203 2025-11-05 cs.SE 75%

LLMs as Judges: Toward The Automatic Review of GSN-compliant Assurance Cases

Gerhard Yu, Mithila Sivakumar, Alvine B. Belle, Soude Ghari, Song Wang, Timothy C. Lethbridge

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01864 2025-11-05 cs.CY 75%

Missing the Margins: A Systematic Literature Review on the Demographic Representativeness of LLMs

Indira Sen, Marlene Lutz, Elisa Rogers, David Garcia, Markus Strohmaier

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Journal ref Findings of the Association for Computational Linguistics (ACL 2025), page 24263

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00689 2025-11-05 cs.CL 70%

Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?

Berk Atil, Rebecca J. Passonneau, Fred Morstatter

机构 * Penn State University(宾夕法尼亚州立大学) Information Sciences Institute, USC(信息科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27195 2025-11-05 cs.CV cs.CL cs.SI 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments ICCV2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10584 2025-11-05 cs.SE cs.AI 70%

ARPaCCino: An Agentic-RAG for Policy as Code Compliance

Francesco Romeo, Luigi Arena, Francesco Blefari, Francesco Aurelio Pironti, Matteo Lupinacci, Angelo Furfaro

机构 * University of Calabria(卡塔尼亚大学) IMT School for Advanced Studies Lucca(卢塞恩高级研究学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17435 2025-11-05 cs.CL 70%

Beyond the Link: Assessing LLMs' ability to Classify Political Content across Global Media

Alejandro De La Fuente-Cuesta, Alberto Martinez-Serra, Nienke Visscher, Laia Castro, Ana S. Cardenal

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20411 2025-11-05 cs.SE cs.CL 70%

SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Andrei Andriushchenko, Maria Trofimova, Daria Litvintseva, Boris Yangel

机构 * Nebius

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

Comments Dataset: https://huggingface.co/datasets/nebius/SWE-rebench, SWE-rebench leaderboard https://swe-rebench.com NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02094 2025-11-05 cs.AI 70%

Automated Reward Design for Gran Turismo

Michel Ma, Takuma Seno, Kaushik Subramanian, Peter R. Wurman, Peter Stone, Craig Sherstan

机构 * Mila, University of Montreal(蒙特利尔大学Mila) Turing Inc.(图灵公司) Sony AI(索尼人工智能) Sony AI, UT Austin(索尼人工智能、得克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02674 2025-11-05 cs.DB 67%

EasyTUS: A Comprehensive Framework for Fast and Accurate Table Union Search across Data Lakes

Tim Otto

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Copyright 2025 IEEE. This is the author's version of the work that has been accepted for publication in Proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025). The final version of record is available at: tba

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02246 2025-11-05 cs.CL cs.AI cs.HC cs.LG 67%

Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results

Jonathan Liu, Haoling Qiu, Jonathan Lasko, Damianos Karakos, Mahsa Yarmohammadi, Mark Dredze

机构 * Princeton University(普林斯顿大学) RTX BBN Technologies(RTX BBN技术公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23495 2025-11-05 cs.CL cs.AI cs.LG 67%

Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking

Liangliang Zhang, Zhuorui Jiang, Hongliang Chi, Haoyang Chen, Mohammed Elkoumy, Fali Wang, Qiong Wu, Zhengyi Zhou, Shirui Pan, Suhang Wang, Yao Ma

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) University of Toronto(多伦多大学) Pennsylvania State University(宾夕法尼亚州立大学) AT&T Chief Data Office(AT&T首席数据办公室) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00537 2025-11-05 cs.CL cs.LG 62%

Multi-refined Feature Enhanced Sentiment Analysis Using Contextual Instruction

Peter Atandoh, Jie Zou, Weikang Guo, Jiwei Wei, Zheng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02832 2025-11-05 cs.RO cs.CV cs.LG 57%

TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System

Yanjie Ze, Siheng Zhao, Weizhuo Wang, Angjoo Kanazawa, Rocky Duan, Pieter Abbeel, Guanya Shi, Jiajun Wu, C. Karen Liu

机构 * Amazon FAR(亚马逊 FAR) Stanford University(斯坦福大学) USC(美国大学) UC Berkeley(伯克利大学) CMU(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments Website: https://yanjieze.com/TWIST2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02831 2025-11-05 cs.LG 57%

GeoCrossBench: Cross-Band Generalization for Remote Sensing

Hakob Tamazyan, Ani Vanyan, Alvard Barseghyan, Anna Khosrovyan, Evan Shelhamer, Hrant Khachatrian

机构 * Hakob Tamazyan(独立研究者) Ani Vanyan(独立研究者) Alvard Barseghyan(独立研究者) Anna Khosrovyan(独立研究者) Evan Shelhamer(独立研究者) Hrant Khachatrian(独立研究者)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02600 2025-11-05 cs.CR cs.AI 57%

On The Dangers of Poisoned LLMs In Security Automation

Patrick Karlsen, Even Eilertsen

机构 * University of Agder(阿格德大学) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09664 2025-11-05 cs.CV cs.LG stat.ML 57%

Image Super-Resolution with Guarantees via Conformalized Generative Models

Eduardo Adame, Daniel Csillag, Guilherme Tegoni Goedert

机构 * School of Applied Mathematics(应用数学学院) Getulio Vargas Foundation(格尔维斯基金会)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

Comments To appear at NeurIPS 2025. 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏