arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-11 至 2025-11-11 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 89 篇

2511.06227 2025-11-11 cs.SE cs.AI cs.CE 90%

Assertion-Aware Test Code Summarization with Large Language Models

Anamul Haque Mollah, Ahmed Aljohani, Hyunsook Do

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted for publication at 2nd ACM International Conference on AI-powered Software (AIware 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20916 2025-11-11 cs.CL 90%

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

Yuan Ge, Junxiang Zhang, Xiaoqian Liu, Bei Li, Xiangnan Ma, Chenglong Wang, Kaiyang Ye, Yangfan Du, Linfeng Zhang, Yuxin Huang, Tong Xiao, Zhengtao Yu, JingBo Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05627 2025-11-11 cs.CY cs.AI 90%

Assessing the Reliability of Large Language Models in the Bengali Legal Context: A Comparative Evaluation Using LLM-as-Judge and Legal Experts

Sabik Aftahee, A. F. M. Farhad, Arpita Mallik, Ratnajit Dhar, Jawadul Karim, Nahiyan Bin Noor, Ishmam Ahmed Solaiman

机构 * Chittagong University of Engineering and Technology(奇坦冈工程与技术大学) ResearchBuddy AI

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13839 2025-11-11 cs.CL cs.AI 90%

Meronymic Ontology Extraction via Large Language Models

Dekai Zhang, Simone Conia, Antonio Rago

机构 * Imperial College London(帝国理工学院伦敦分校) Sapienza University of Rome(罗马大学萨皮恩扎分校) King’s College London(伦敦国王学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15987 2025-11-11 cs.CL cs.AI 90%

Likelihood-based Mitigation of Evaluation Bias in Large Language Models

Masanari Oi, Masahiro Kaneko, Ryuto Koike, Mengsay Loem, Naoaki Okazaki

机构 * Tokyo Institute of Technology(东京技术大学) MBZUAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 5 main pages

Journal ref ACL2024 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07085 2025-11-11 cs.HC cs.AI cs.CV 89%

Achieving Effective Virtual Reality Interactions via Acoustic Gesture Recognition based on Large Language Models

Xijie Zhang, Fengliang He, Hong-Ning Dai

机构 * Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 5 pages, 4 figures, 1 table, under review at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04076 2025-11-11 cs.AI 89%

Agentmandering: A Game-Theoretic Framework for Fair Redistricting via Large Language Model Agents

Hao Li, Haotian Chen, Ruoyuan Gong, Juanjuan Wang, Hao Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted by AAAI AISI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02009 2025-11-11 cs.CY cs.CL 89%

Urban Computing in the Era of Large Language Models

Zhonghang Li, Lianghao Xia, Xubin Ren, Jiabin Tang, Tianyi Chen, Yong Xu, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments https://github.com/HKUDS/Awesome-LLM4Urban-Papers

Journal ref ACM TIST, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03739 2025-11-11 cs.CV 89%

ChestGPT: Integrating Large Language Models and Vision Transformers for Disease Detection and Localization in Chest X-Rays

Shehroz S. Khan, Petar Przulj, Ahmed Ashraf, Ali Abedi

机构 * College of Engineering and Technology, American University of the Middle East(工程与技术学院,中东大学) Faculty of Applied Science and Engineering, University of Toronto(应用科学与工程学院,多伦多大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(KITE研究机构,多伦多康复研究所,大学健康网络)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04372 2025-11-11 cs.LG cs.AI cs.SE 88%

Benchmarking Large Language Models with Integer Sequence Generation Tasks

Daniel O'Malley, Manish Bhattarai, Nishath Rajiv Ranasinghe, Erick Draayer, Javier Santos

机构 * Earth and Environmental Sciences Division Los Alamos National Laboratory(地球与环境科学 division 洛斯阿拉莫斯国家实验室) Theoretical Division Los Alamos National Laboratory(理论 division 洛斯阿拉莫斯国家实验室) Computational Sciences Division Los Alamos National Laboratory(计算科学 division 洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07193 2025-11-11 cs.CL 88%

EMODIS: A Benchmark for Context-Dependent Emoji Disambiguation in Large Language Models

Jiacheng Huang, Ning Yu, Xiaoyin Yi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13333 2025-11-11 cs.AI 88%

Evaluation Awareness Scales Predictably in Open-Weights Large Language Models

Maheep Chaudhary, Ian Su, Nikhil Hooda, Nishith Shankar, Julia Tan, Kevin Zhu, Ryan Lagasse, Vasu Sharma, Ashwinee Panda

机构 * Independent(独立研究者) UC Irvine(加州大学尔湾分校) University of Waterloo(滑铁卢大学) UW Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学) Algoverse(Algoverse公司) META University of Maryland(马里兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12039 2025-11-11 cs.CL 88%

A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans

Anca Dinu, Andra-Maria Florescu, Alina Resceanu

机构 * University of Bucharest(布加勒斯大学) Interdisciplinary School of Doctoral Studies(跨学科博士研究学校) University of Craiova(克里奥瓦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted for presentation at KES 2025. To appear in Procedia Computer Science (Elsevier)

Journal ref Procedia Computer Science 270 (2025) 1292-1301

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02311 2025-11-11 cs.CL 88%

Invoke Interfaces Only When Needed: Adaptive Invocation for Large Language Models in Question Answering

Jihao Zhao, Chunlai Zhou, Daixuan Li, Shuaishuai Zu, Biao Qin

机构 * School of Information, Renmin University of China(信息学院,中国人民大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);small language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13624 2025-11-11 cs.CL cs.LG 86%

Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning

Shambhavi Krishna, Atharva Naik, Chaitali Agarwal, Sudharshan Govindan, Taesung Lee, Haw-Shiuan Chang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Anthropic

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 14th Joint Conference on Lexical and Computational Semantics (*SEM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01599 2025-11-11 cs.CL cs.CR cs.CV cs.LG 86%

JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models

Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学) Boise State University(博伊西州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12618 2025-11-11 cs.CL 85%

OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics

Vineeth Dorna, Anmol Mekala, Wenlong Zhao, Andrew McCallum, Zachary C. Lipton, J. Zico Kolter, Pratyush Maini

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Carnegie Mellon University(卡内基梅隆大学) DatologyAI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06212 2025-11-11 cs.CR cs.AI 85%

RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework

Seif Ikbarieh, Kshitiz Aryal, Maanak Gupta

机构 * Department of Computer Science(计算机科学系) Tennessee Tech University(田纳西科技大学) School of Interdisciplinary Informatics(跨学科信息学学院) University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05496 2025-11-11 cs.IR cs.AI 85%

DOCUEVAL: An LLM-based AI Engineering Tool for Building Customisable Document Evaluation Workflows

Hao Zhang, Qinghua Lu, Liming Zhu

机构 * CSIRO’s Data61(CSIRO数据61)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07168 2025-11-11 cs.DL 85%

LEAD: LLM-enhanced Engine for Author Disambiguation

Giusy Giulia Tuccari, Lorenzo Giammei, Andrea Giovanni Nuzzolese, Misael Mongiovì, Antonio Zinilli, Francesco Poggi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06268 2025-11-11 cs.CV cs.CY 85%

LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval

Jian Zhang, Junyi Guo, Junyi Yuan, Huanda Lu, Yanlin Zhou, Fangyu Wu, Qiufeng Wang, Dongming Lu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Dunhuang Academy(敦煌研究院) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23313 2025-11-11 cs.CR 85%

Network Intrusion Detection: Evolution from Conventional Approaches to LLM Collaboration and Emerging Risks

Yaokai Feng, Kouichi Sakurai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 29 pages,1 figure, 213 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06552 2025-11-11 cs.SE cs.AI 83%

LLM For Loop Invariant Generation and Fixing: How Far Are We?

Mostafijur Rahman Akhond, Saikat Chakraborty, Gias Uddin

机构 * York University(约克大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24826 2025-11-11 cs.CL cs.CV 83%

LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text

Li yunhan, Wu gengshen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07364 2025-11-11 cs.LG cs.AI cs.CL 81%

Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection

Vaibhav Mavi, Shubh Jaroria, Weiqi Sun

机构 * Dyania Health(Dyania健康)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07237 2025-11-11 cs.CL cs.AI 81%

LLM-C3MOD: A Human-LLM Collaborative System for Cross-Cultural Hate Speech Moderation

Junyeong Park, Seogyeong Jeong, Seyoung Song, Yohan Lee, Alice Oh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Workshop - C3NLP (Workshop on Cross-Cultural Considerations in NLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20318 2025-11-11 cs.CL cs.AI cs.LG stat.ML 80%

Quriosity: Analyzing Human Questioning Behavior and Causal Inquiry through Curiosity-Driven Queries

Roberto Ceraolo, Dmitrii Kharlapenko, Ahmad Khan, Amélie Reymond, Punya Syon Pandey, Rada Mihalcea, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

机构 * EPFL(苏黎世联邦理工学院) ETH Zürich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Michigan(密歇根大学) MPI for Intelligent Systems, Tübingen, Germany(图宾根智能系统研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17013 2025-11-11 cs.CL 79%

DiscoTrack: A Multilingual LLM Benchmark for Discourse Tracking

Lanni Bu, Lauren Levine, Amir Zeldes

机构 * Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 79%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23089 2025-11-11 cs.LG cs.NI 79%

Demystifying Network Foundation Models

Sylee Beltiukov, Satyandra Guthula, Wenbo Guo, Walter Willinger, Arpit Gupta

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) NIKSUN, Inc(NIKSUN公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏