arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-22 至 2025-10-22 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2510.18339 2025-10-22 cs.CL cs.LG 92%

ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography

Lara Ahrens, Wilhelm Haverkamp, Nils Strodthoff

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 34 pages, 8 figures, code available at https://github.com/AI4HealthUOL/ecg-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09710 2025-10-22 cs.CL cs.AI cs.LG 91%

Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data

Sepehr Golrokh Amin, Devin Rhoads, Fatemeh Fakhrmoosavi, Nicholas E. Lownes, John N. Ivan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09165 2025-10-22 cs.CL cs.AI cs.IR 90%

When Text Embedding Meets Large Language Model: A Comprehensive Survey

Zhijie Nie, Zhangchi Feng, Mingxin Li, Cunwang Zhang, Yanzhao Zhang, Dingkun Long, Richong Zhang

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments Version 4: We added the latest works of LLM-based Embedders

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18456 2025-10-22 cs.SE 89%

Large Language Models in Thematic Analysis: Prompt Engineering, Evaluation, and Guidelines for Qualitative Software Engineering Research

Cristina Martinez Montes, Robert Feldt, Cristina Miguel Martos, Sofia Ouhbi, Shweta Premanandan, Daniel Graziotin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10255 2025-10-22 cs.CV cs.RO 89%

When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models

Xianzheng Ma, Brandon Smart, Yash Bhalgat, Shuai Chen, Xinghui Li, Jian Ding, Jindong Gu, Dave Zhenyu Chen, Songyou Peng, Jia-Wang Bian, Philip H Torr, Marc Pollefeys, Matthias Nießner, Ian D Reid, Angel X. Chang, Iro Laina, Victor Adrian Prisacariu

机构 * University of Oxford(牛津大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Simon Fraser University(西蒙·弗雷泽大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 2nd version update to Jun.2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00063 2025-10-22 astro-ph.IM cs.AI 88%

AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy

Jinghang Shi, Xiaoyu Tang, Yang Huang, Yuyang Li, Xiao Kong, Yanxia Zhang, Caizhan Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09507 2025-10-22 cs.AI 88%

An Automated Multi-modal Evaluation Framework for Mobile Intelligent Assistants Based on Large Language Models and Multi-Agent Collaboration

Meiping Wang, Jian Zhong, Rongduo Han, Liming Kang, Zhengkun Shi, Xiao Liang, Xing Lin, Nan Gao, Haining Zhang

机构 * College of Software, Nankai University(南开大学软件学院) vivo AI Lab(vivo人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18728 2025-10-22 cs.LG 88%

PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries

Steven Kolawole, Keshav Santhanam, Virginia Smith, Pratiksha Thaker

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18454 2025-10-22 cs.CL 87%

Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models

Atharvan Dogra, Soumya Suvra Ghosal, Ameet Deshpande, Ashwin Kalyan, Dinesh Manocha

机构 * Centre for Responsible AI, IIT Madras(负责任人工智能中心,印度理工学院马德拉斯分校) University of Maryland, College Park(马里兰大学 College Park 分校) Princeton University(普林斯顿大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18162 2025-10-22 cs.CL cs.AI 86%

Automatic Prompt Generation via Adaptive Selection of Prompting Techniques

Yohei Ikenoue, Hitomi Tashiro, Shigeru Kuroyanagi

机构 * Spike Studio Inc.(Spike Studio公司)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 29 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18601 2025-10-22 cs.CR cs.SE 86%

Evaluating Large Language Models in detecting Secrets in Android Apps

Marco Alecci, Jordan Samhi, Tegawendé F. Bissyandé, Jacques Klein

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03417 2025-10-22 cs.CR cs.AI 85%

NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks

Javad Rafiei Asl, Sidhant Narula, Mohammad Ghasemigol, Eduardo Blanco, Daniel Takabi

机构 * Old Dominion University(旧 Dominion 大学) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments This paper has been accepted in the main conference proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025). Javad Rafiei Asl and Sidhant Narula are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03655 2025-10-22 cs.CY cs.CL 85%

Facts are Harder Than Opinions -- A Multilingual, Comparative Analysis of LLM-Based Fact-Checking Reliability

Lorraine Saju, Arnim Bleier, Jana Lasser, Claudia Wagner

机构 * GESIS – Leibniz Institute for the Social Sciences(GESIS社会科学院研究所) RWTH Aachen University(亚琛RWTH大学) University of Graz(格拉茨大学) Complexity Science Hub(复杂性科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18585 2025-10-22 cs.CR 85%

CLASP: Cost-Optimized LLM-based Agentic System for Phishing Detection

Fouad Trad, Ali Chehab

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted in the 5th International Conference on Electrical, Computer, and Energy Technologies (ICECET2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18550 2025-10-22 cs.NI 85%

JAUNT: Joint Alignment of User Intent and Network State for QoE-centric LLM Tool Routing

Enhan Li, Hongyang Du

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02186 2025-10-22 cs.HC 85%

EvalAssist: A Human-Centered Tool for LLM-as-a-Judge

Zahra Ashktorab, Werner Geyer, Michael Desmond, Elizabeth M. Daly, Martin Santillan Cooper, Qian Pan, Erik Miehling, Tejaswini Pedapati, Hyo Jin Do

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2410.00873

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17843 2025-10-22 cs.LG cs.AI cs.SE 84%

GRETEL: A Goal-driven Retrieval and Execution-based Trial Framework for LLM Tool Selection Enhancing

Zongze Wu, Yani Guo, Churong Liang, Runnan Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 1 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18425 2025-10-22 cs.AI 83%

Automated urban waterlogging assessment and early warning through a mixture of foundation models

Chenxu Zhang, Fuxiang Huang, Lei Zhang

专题命中 评测与基准 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

Comments Submitted to Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17173 2025-10-22 cs.AI cs.CL 82%

Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users

Melik Ozolcer, Sang Won Bae

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI;large language model(comments);language model(comments)

Comments Accepted to the NeurIPS 2025 Workshop on Multi-Turn Interactions in Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04150 2025-10-22 cs.CL cs.AI 82%

Temporal Alignment of LLMs through Cycle Encoding for Long-Range Time Representations

Xue Han, Qian Hu, Yitong Wang, Wenchun Gao, Lianlian Zhang, Qing Wang, Lijun Mei, Chao Deng, Junlan Feng

机构 * JIUTIAN Team China Mobile Research Institute(中国移动研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18563 2025-10-22 cs.CR 82%

The Trust Paradox in LLM-Based Multi-Agent Systems: When Collaboration Becomes a Security Vulnerability

Zijie Xu, Minfeng Qi, Shiqing Wu, Lefeng Zhang, Qiwen Wei, Han He, Ningran Li

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18745 2025-10-22 cs.CL 79%

Topoformer: brain-like topographic organization in Transformer language models through spatial querying and reweighting

Taha Binhuraib, Greta Tuckute, Nicholas Blauch

机构 * Novus Technologies MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments ICLR 2024 Workshop on Representational Alignment (Re-Align) Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18491 2025-10-22 cs.AI 79%

Crucible: Quantifying the Potential of Control Algorithms through LLM Agents

Lianchen Jia, Chaoyang Li, Qian Houde, Tianchi Huang, Jiangchuan Liu, Lifeng Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Simon Fraser University(西蒙 Fraser大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18188 2025-10-22 cs.CV cs.AI 79%

RadDiagSeg-M: A Vision Language Model for Joint Diagnosis and Multi-Target Segmentation in Radiology

Chengrun Li, Corentin Royer, Haozhe Luo, Bastian Wittmann, Xia Li, Ibrahim Hamamci, Sezgin Er, Anjany Sekuboyina, Bjoern Menze

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18080 2025-10-22 cs.LG 79%

MEG-GPT: A transformer-based foundation model for magnetoencephalography data

Rukuang Huang, Sungjun Cho, Chetan Gohil, Oiwi Parker Jones, Mark Woolrich

机构 * Oxford Centre for Integrative Neuroimaging (OxCIN)(牛津整合神经影像中心) University of Oxford(牛津大学) Department of Psychiatry(精神病学系) Nuffield Department of Clinical Neurosciences(努尔菲尔德临床神经科学系) Department of Engineering Science(工程科学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13982 2025-10-22 cs.MA cs.AI 79%

Static Sandboxes Are Inadequate: Modeling Societal Complexity Requires Open-Ended Co-Evolution in LLM-Based Multi-Agent Simulations

Jinkun Chen, Sher Badshah, Xuemin Yu, Sijia Han

机构 * Meta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11097 2025-10-22 cs.CL cs.AI cs.IR 79%

C-SEO Bench: Does Conversational SEO Work?

Haritz Puerto, Martin Gubri, Tommaso Green, Seong Joon Oh, Sangdoo Yun

机构 * Parameter Lab(参数实验室) UKP Lab(UKP实验室) Technical University of Darmstadt(达姆施塔特技术大学) Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NAVER AI Lab(NAVER人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS Datasets & Benchmarks 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12041 2025-10-22 cs.CL cs.AI 79%

A Survey of Automatic Hallucination Evaluation on Natural Language Generation

Siya Qi, Lin Gui, Yulan He, Zheng Yuan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18178 2025-10-22 cond-mat.mtrl-sci physics.chem-ph 78%

MACE Foundation Models for Lattice Dynamics: A Benchmark Study on Double Halide Perovskites

Jack Yang, Ziqi Yin, Lei Ao, Sean Li

专题命中 评测与基准 :foundation model(title,abstract)

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17960 2025-10-22 astro-ph.IM astro-ph.CO 78%

AION-1: Omnimodal Foundation Model for Astronomical Sciences

Liam Parker, Francois Lanusse, Jeff Shen, Ollie Liu, Tom Hehir, Leopoldo Sarra, Lucas Meyer, Micah Bowles, Sebastian Wagner-Carena, Helen Qu, Siavash Golkar, Alberto Bietti, Hatim Bourfoune, Nathan Casserau, Pierre Cornette, Keiya Hirashima, Geraud Krawezik, Ruben Ohana, Nicholas Lourie, Michael McCabe, Rudy Morel, Payel Mukhopadhyay, Mariel Pettee, Bruno Regaldo-Saint Blancard, Kyunghyun Cho, Miles Cranmer, Shirley Ho

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted at Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏