arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-11 至 2025-11-11 共收录 355 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 89 篇

2511.06212 2025-11-11 cs.CR cs.AI 85%

RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework

Seif Ikbarieh, Kshitiz Aryal, Maanak Gupta

机构 * Department of Computer Science(计算机科学系) Tennessee Tech University(田纳西科技大学) School of Interdisciplinary Informatics(跨学科信息学学院) University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05496 2025-11-11 cs.IR cs.AI 85%

DOCUEVAL: An LLM-based AI Engineering Tool for Building Customisable Document Evaluation Workflows

Hao Zhang, Qinghua Lu, Liming Zhu

机构 * CSIRO’s Data61(CSIRO数据61)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07168 2025-11-11 cs.DL 85%

LEAD: LLM-enhanced Engine for Author Disambiguation

Giusy Giulia Tuccari, Lorenzo Giammei, Andrea Giovanni Nuzzolese, Misael Mongiovì, Antonio Zinilli, Francesco Poggi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06268 2025-11-11 cs.CV cs.CY 85%

LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval

Jian Zhang, Junyi Guo, Junyi Yuan, Huanda Lu, Yanlin Zhou, Fangyu Wu, Qiufeng Wang, Dongming Lu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Dunhuang Academy(敦煌研究院) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23313 2025-11-11 cs.CR 85%

Network Intrusion Detection: Evolution from Conventional Approaches to LLM Collaboration and Emerging Risks

Yaokai Feng, Kouichi Sakurai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 29 pages,1 figure, 213 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06552 2025-11-11 cs.SE cs.AI 83%

LLM For Loop Invariant Generation and Fixing: How Far Are We?

Mostafijur Rahman Akhond, Saikat Chakraborty, Gias Uddin

机构 * York University(约克大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24826 2025-11-11 cs.CL cs.CV 83%

LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text

Li yunhan, Wu gengshen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07364 2025-11-11 cs.LG cs.AI cs.CL 81%

Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection

Vaibhav Mavi, Shubh Jaroria, Weiqi Sun

机构 * Dyania Health(Dyania健康)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07237 2025-11-11 cs.CL cs.AI 81%

LLM-C3MOD: A Human-LLM Collaborative System for Cross-Cultural Hate Speech Moderation

Junyeong Park, Seogyeong Jeong, Seyoung Song, Yohan Lee, Alice Oh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Workshop - C3NLP (Workshop on Cross-Cultural Considerations in NLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20318 2025-11-11 cs.CL cs.AI cs.LG stat.ML 80%

Quriosity: Analyzing Human Questioning Behavior and Causal Inquiry through Curiosity-Driven Queries

Roberto Ceraolo, Dmitrii Kharlapenko, Ahmad Khan, Amélie Reymond, Punya Syon Pandey, Rada Mihalcea, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

机构 * EPFL(苏黎世联邦理工学院) ETH Zürich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Michigan(密歇根大学) MPI for Intelligent Systems, Tübingen, Germany(图宾根智能系统研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17013 2025-11-11 cs.CL 79%

DiscoTrack: A Multilingual LLM Benchmark for Discourse Tracking

Lanni Bu, Lauren Levine, Amir Zeldes

机构 * Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 79%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23089 2025-11-11 cs.LG cs.NI 79%

Demystifying Network Foundation Models

Sylee Beltiukov, Satyandra Guthula, Wenbo Guo, Walter Willinger, Arpit Gupta

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) NIKSUN, Inc(NIKSUN公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05639 2025-11-11 cs.CL 79%

ECom-Bench: Can LLM Agent Resolve Real-World E-commerce Customer Support Issues?

Haoxin Wang, Xianhan Peng, Xucheng Huang, Yizhe Huang, Ming Gong, Chenghan Yang, Yang Liu, Ling Jiang

机构 * Xiaoduo AI Lab(小多人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00078 2025-11-11 cs.CV cs.AI eess.IV 79%

Evaluating Cell AI Foundation Models in Kidney Pathology with Human-in-the-Loop Enrichment

Junlin Guo, Siqi Lu, Can Cui, Ruining Deng, Tianyuan Yao, Zhewen Tao, Yizhe Lin, Marilyn Lionts, Quan Liu, Juming Xiong, Yu Wang, Shilin Zhao, Catie Chang, Mitchell Wilkes, Mengmeng Yin, Haichun Yang, Yuankai Huo

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Shanghai JiaoTong University School of Medicine(上海交通大学医学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05542 2025-11-11 q-bio.NC cs.AI cs.CV cs.LG 79%

ConnectomeBench: Can LLMs Proofread the Connectome?

Jeff Brown, Andrew Kirjner, Annika Vivekananthan, Ed Boyden

机构 * MIT(麻省理工学院) HHMI(霍华德·休斯医学研究所) McGovern Institute(麦戈文研究所) MIT Departments of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments To appear in NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04698 2025-11-11 cs.CL cs.AI 79%

multiMentalRoBERTa: A Fine-tuned Multiclass Classifier for Mental Health Disorder

K M Sajjadul Islam, John Fields, Praveen Madiraju

机构 * Marquette University, WI, USA(马quette大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted in IEEE Big Data, 8-11 December, 2025 @ Macau SAR, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01710 2025-11-11 cs.CL cs.LG 79%

CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications

Raviraj Joshi, Rakesh Paul, Kanishk Singla, Anusha Kamath, Michael Evans, Katherine Luna, Shaona Ghosh, Utkarsh Vaidya, Eileen Long, Sanjay Singh Chauhan, Niranjan Wartikar

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19730 2025-11-11 cs.CV 78%

Improving Generalization in Deepfake Detection with Face Foundation Models and Metric Learning

Stelios Mylonas, Symeon Papadopoulos

专题命中 评测与基准 :foundation model(title,abstract)

Comments The authors did not manage to secure approval by the funder of this research on time

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06337 2025-11-11 cs.CV 78%

BuildingWorld: A Structured 3D Building Dataset for Urban Foundation Models

Shangfeng Huang, Ruisheng Wang, Xin Wang

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05551 2025-11-11 cs.CV 78%

In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing

Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 评测与基准 :language model(title,abstract)

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21844 2025-11-11 cs.CV 78%

Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation

Mehrdad Noori, David Osowiechi, Gustavo Adolfo Vargas Hakim, Ali Bahri, Moslem Yazdanpanah, Sahar Dastani, Farzad Beizaee, Ismail Ben Ayed, Christian Desrosiers

机构 * LIVIA, ÉTS Montréal, Canada International Laboratory on Learning Systems (ILLS)(LIVIA,蒙特利尔ÉTS,加拿大国际学习系统实验室)

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18201 2025-11-11 cs.RO 78%

What Foundation Models can Bring for Robot Learning in Manipulation : A Survey

Dingzhe Li, Yixiang Jin, Yuhao Sun, Yong A, Hongze Yu, Jun Shi, Xiaoshuai Hao, Peng Hao, Huaping Liu, Xiang Li, Xinde Li, Fuchun Sun, Jianwei Zhang, Bin Fang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Southeast University(东南大学) Universität Hamburg(汉堡大学)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07382 2025-11-11 cs.CL 77%

Retriv at BLP-2025 Task 2: Test-Driven Feedback-Guided Framework for Bangla-to-Python Code Generation

K M Nafi Asib, Sourav Saha, Mohammed Moshiul Hoque

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments 8 pages, 1 figure, experimental scripts publicly available at https://github.com/NafiAsib/Retriv-BLP25-Task-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06738 2025-11-11 cs.CL 77%

Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights

Hyunjae Kim, Jiwoong Sohn, Aidan Gilson, Nicholas Cochran-Caggiano, Serina Applebaum, Heeju Jin, Seihee Park, Yujin Park, Jiyeong Park, Seoyoung Choi, Brittany Alexandra Herrera Contreras, Thomas Huang, Jaehoon Yun, Ethan F. Wei, Roy Jiang, Leah Colucci, Eric Lai, Amisha Dave, Tuo Guo, Maxwell B. Singer, Yonghoe Koo, Ron A. Adelman, James Zou, Andrew Taylor, Arman Cohan, Hua Xu, Qingyu Chen

机构 * Yale School of Medicine(耶鲁医学院) Yale University(耶鲁大学) ETH Zurich(苏黎世联邦理工学院) Harvard Medical School(哈佛医学院) Geisel School of Medicine at Dartmouth(达特茅斯大学盖塞医学院) Seoul National University College of Medicine(首尔国立大学医学院) Hanyang University College of Medicine(翰林大学医学院) PA Leadership Charter School(宾夕法尼亚州西切斯特市领导学校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06530 2025-11-11 cs.CL 77%

Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement

Xiaonan Luo, Yue Huang, Ping He, Xiangliang Zhang

机构 * University of Notre Dame(诺特大学) Vanderbilt University(范德比大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06301 2025-11-11 cs.AI 77%

Secu-Table: a Comprehensive security table dataset for evaluating semantic table interpretation systems

Azanzi Jiomekong, Jean Bikim, Patricia Negoue, Joyce Chin

机构 * University of Yaounde I(雅温迪大学) TIB Leibniz Information Centre for Science and Technology(利普修斯信息科学与技术研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07290 2025-11-11 eess.IV cs.CV cs.MM 75%

CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video

Xinyi Wang, Angeliki Katsenou, Junxiao Shen, David Bull

机构 * School of Computer Science, University of Bristol(布里斯托大学计算机科学学院)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);prompting(abstract)

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06186 2025-11-11 cs.SE 75%

Diagnosing and Resolving Android Applications Building Issues: An Empirical Study

Lakshmi Priya Bodepudi, Yutong Zhao, Ming Quan Fu, Yuanyuan Wu, Sen He, Yu Zhao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05530 2025-11-11 cs.CY 75%

Using LLMs to support assessment of student work in higher education: a viva voce simulator

Ian M. Church, Lyndon Drake, Mark Harris

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏