arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-20 至 2025-11-20 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 37 篇

2511.15059 2025-11-20 cs.CV cs.CL 89%

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(日本国立信息机构) NII LLMC Tokyo, Japan(日本国立信息机构LLMC东京)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15574 2025-11-20 cs.CL cs.AI 88%

HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning

HSKBenchmark: 通过课程调优建模和评估大语言模型中的中文第二语言习得

Qihao Yang, Xuelin Wang, Jiale Chen, Xuelian Dong, Yuxin Hao, Tianyong Hao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 HSKBenchmark通过课程调优构建首个中文SLA大语言模型基准,涵盖HSK 3-6级,提供教学文本、合成指令和评估系统,验证LLMs在写作和语法上的表现。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01418 2025-11-20 cs.CL 88%

On the Alignment of Large Language Models with Global Human Opinion

Yang Liu, Masahiro Kaneko, Chenhui Chu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14342 2025-11-20 cs.CL 88%

ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions

Xingwei He, Qianru Zhang, Pengfei Chen, Guanhua Chen, Linlin Yu, Yuan Yuan, Siu-Ming Yiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15030 2025-11-20 eess.SP 87%

WiCo-PG: Wireless Channel Foundation Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Ziwei Huang, Xuesong Cai, Xiang Cheng, Jianjun Wu

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14788 2025-11-20 cs.AI stat.AP 86%

Subnational Geocoding of Global Disasters Using Large Language Models

Michele Ronco, Damien Delforge, Wiebke S. Jäger, Christina Corbane

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15698 2025-11-20 cs.CY cs.LG 85%

RescueLens: LLM-Powered Triage and Action on Volunteer Feedback for Food Rescue

RescueLens:基于大语言模型的志愿者反馈 triage 和行动

Naveen Raman, Jingwu Tang, Zhiyu Chen, Zheyuan Ryan Shi, Sean Hudson, Ameesh Kapoor, Fei Fang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RescueLens利用大语言模型自动处理志愿者反馈,提高食品救援组织的反馈管理效率和问题解决能力。

Comments Accepted at IAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15357 2025-11-20 cs.LG 85%

Cost-Aware Prediction (CAP): An LLM-Enhanced Machine Learning Pipeline and Decision Support System for Heart Failure Mortality Prediction

Yinan Yu, Falk Dippel, Christina E. Lundberg, Martin Lindgren, Annika Rosengren, Martin Adiels, Helen Sjöland

机构 * Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和哥德堡大学) Sahlgrenska University Hospital(萨尔姆斯卡大学医院) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,萨尔姆斯卡学院,哥德堡大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,萨尔姆斯卡大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,哥德堡大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学学院,医学院,哥德堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15203 2025-11-20 cs.CR cs.AI 85%

Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks

Zimo Ji, Xunguang Wang, Zongjie Li, Pingchuan Ma, Yudong Gao, Daoyuan Wu, Xincheng Yan, Tian Tian, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Lingnan University(岭南大学) School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ZTE Corporation(中兴通讯有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14439 2025-11-20 cs.CL 85%

MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents

Jinru Ding, Lu Lu, Chao Ding, Mouxiao Bian, Jiayuan Chen, Wenrao Pang, Ruiyao Chen, Xinwei Peng, Renjie Lu, Sijie Ren, Guanxu Zhu, Xiaoqin Wu, Zhiqiang Liu, Rongzhao Zhang, Luyi Jiang, Bing Han, Yunqiu Wang, Jie Xu

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11823 2025-11-20 cs.HC 85%

CollaClassroom: An AI-Augmented Collaborative Learning Platform with LLM Support in the Context of Bangladeshi University Students

Salman Sayeed, Bijoy Ahmed Saiem, Al-Amin Sany, Sadia Sharmin, A. B. M. Alim Al Islam

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22830 2025-11-20 cs.CL cs.LG 84%

Exploration of Summarization by Generative Language Models for Automated Scoring of Long Essays

Haowei Hua, Hong Jiao, Xinyi Wang

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 19 pages, 5 Tables 7 Figures, Presentation at Artificial Intelligence in Measurement and Education Conference (AIME-Con)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14160 2025-11-20 cs.CL cs.LG 81%

Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07079 2025-11-20 eess.IV cs.AI cs.CV cs.LG 81%

Anatomical Foundation Models for Brain MRIs

Carlo Alberto Barbano, Matteo Brunello, Benoit Dufumier, Marco Grangetto

机构 * University of Turin(都灵大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Updated version; added ablation study

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15061 2025-11-20 cs.AI cs.IR cs.LG 79%

Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering

Haodong Chen, Guido Zuccon, Teerapong Leelanupab

机构 * The University of Queensland(昆士兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted to SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11346 2025-11-20 cs.SE 78%

RefModel: Detecting Refactorings using Foundation Models

Pedro Simões, Rohit Gheyi, Rian Melo, Jonhnanthan Oliveira, Márcio Ribeiro, Wesley K. G. Assunção

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted at Brazilian Symposium on Software Engineering (SBES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15026 2025-11-20 eess.SP 78%

WiCo-MG: Wireless Channel Foundation Model for Multipath Generation via Synesthesia of Machines

Zengrui Han, Lu Bai, Xuesong Cai, Xiang Cheng

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15260 2025-11-20 cs.CL 77%

IndicGEC: Powerful Models, or a Measurement Mirage?

Sowmya Vajjala

专题命中 评测与基准 :language model(abstract);small language model(abstract);prompting(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15191 2025-11-20 cs.AI 77%

HISE-KT: Synergizing Heterogeneous Information Networks and LLMs for Explainable Knowledge Tracing with Meta-Path Optimization

Zhiyi Duan, Zixing Shi, Hongyu Yuan, Qi Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18015 2025-11-20 cs.CV cs.AI 77%

Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs

Advait Gosai, Arun Kavishwar, Stephanie L. McNamara, Soujanya Samineni, Renato Umeton, Alexander Chowdhury, William Lotter

机构 * University of California(加州大学) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Massachusetts General Hospital(麻省总医院) St. Jude Children’s Research Hospital(圣犹大儿童研究医院) Brigham and Women’s Hospital & Harvard Medical School(布里法伦医院及哈佛医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments Proceedings of the 5th Machine Learning for Health (ML4H) Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14937 2025-11-20 cs.CR 75%

CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs

Niloofar Mireshghallah, Neal Mangaokar, Narine Kokhlikyan, Arman Zharmagambetov, Manzil Zaheer, Saeed Mahloujifar, Kamalika Chaudhuri

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14903 2025-11-20 cs.LG cs.SE 74%

It's LIT! Reliability-Optimized LLMs with Inspectable Tools

Ruixin Zhang, Jon Donnelly, Zhicheng Guo, Ghazal Khalighinejad, Haiyang Huang, Alina Jade Barnett, Cynthia Rudin

机构 * Department of Computer Science(计算机科学系) Duke University(杜克大学)

专题命中 评测与基准 :large language model(abstract,comments);language model(abstract,comments);分类 cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Multi-Turn Interactions in Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14772 2025-11-20 cs.CL cs.AI 73%

Test-time Scaling of LLMs: A Survey from A Subproblem Structure Perspective

Zhuoyi Yang, Xu Guo, Tong Zhang, Huijuan Xu, Boyang Li

机构 * Department of Computer Science and Engineering, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学与工程系) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14765 2025-11-20 cs.IR cs.AI cs.CL 73%

Optimizing Agricultural Research: A RAG-Based Approach to Mycorrhizal Fungi Information

Mohammad Usman Altam, Md Imtiaz Habib, Tuan Hoang

机构 * Data Science and Artificial Intelligence Université Côte d’Azur(数据科学与人工智能 巴黎-萨克雷大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14798 2025-11-20 cs.SE cs.AI cs.CY 70%

Evaluating Generative AI for CS1 Code Grading: Direct vs Reverse Methods

Ahmad Memon, Abdallah Mohamed

机构 * University of British Columbia Okanagan(不列颠哥伦比亚大学奥克兰分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 5 figures. This version corresponds to the paper accepted for presentation at CASCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13326 2025-11-20 stat.AP cs.AI 70%

TacEleven: generative tactic discovery for football open play

Siyao Zhao, Hao Ma, Zhiqiang Pu, Jingjing Huang, Yi Pan, Shijie Wang, Zhi Ming

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(交叉科学学院,中国科学院大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shanghai AI Laboratory(上海人工智能实验室) Association de la Jeunesse Auxerroise(亚眠青年协会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15210 2025-11-20 cs.CL cs.AI cs.LG 67%

Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story

Vladislav Pedashenko, Laida Kushnareva, Yana Khassan Nibal, Eduard Tulchinskii, Kristian Kuznetsov, Vladislav Zharchinskii, Yury Maximov, Irina Piontkovskaya

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00261 2025-11-20 cs.CV cs.HC 67%

Spot The Ball: A Benchmark for Visual Social Inference

Neha Balamurugan, Sarah Wu, Adam Chun, Gabe Gaw, Cristobal Eyzaguirre, Tobias Gerstenberg

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15383 2025-11-20 cs.CL cs.AI cs.ET cs.IR 62%

A Compliance-Preserving Retrieval System for Aircraft MRO Task Search

一种保持合规性的航空维修任务检索系统

Byungho Jo

机构 * AI Convergence Reserach Center, Inha University(人工智能融合研究中心,庆尚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种保持合规性的航空维修任务检索系统,通过结合LLM重排序和语义搜索,提升航空维修工作效率并减少查找时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15183 2025-11-20 cs.CL cs.LG 62%

HinTel-AlignBench: A Framework and Benchmark for Hindi-Telugu with English-Aligned Samples

Rishikant Chigrupaatii, Ponnada Sai Tulasi Kanishka, Lalit Chandra Routhu, Martin Patel Sama Supratheek Reddy, Divyam Gupta, Dasari Srikar, Krishna Teja Kuchimanchi, Rajiv Misra, Rohun Tripathi

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏