arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-13 至 2025-10-13 共收录 54 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2508.00047 2025-10-13 cs.LG cs.AI 92%

TriP-LLM: A Tri-Branch Patch-wise Large Language Model Framework for Time-Series Anomaly Detection

Yuan-Cheng Yu, Yen-Chieh Ouyang, Chun-An Lin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted version of the paper published in IEEE Access (2025). Licensed under a Creative Commons Attribution 4.0 License (CC BY 4.0). Published version available at IEEE Xplore

Journal ref IEEE Access, vol. 13, pp. 168643-168653, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09418 2025-10-13 cs.CL cs.LG 90%

Active Model Selection for Large Language Models

Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

机构 * TU Delft(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21164 2025-10-13 cs.CL cs.AI 90%

Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations

Muskan Saraf, Sajjad Rezvani Boroujeni, Justin Beaudry, Hossein Abedi, Tom Bush

机构 * Data Science Department, Actual Reality Technologies(数据科学部门,Actual Reality Technologies) Software Department, Actual Reality Technologies(软件部门,Actual Reality Technologies) Actual Reality Technologies

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09355 2025-10-13 cs.CL 89%

NL2GenSym: Natural Language to Generative Symbolic Rules for SOAR Cognitive Architecture via Large Language Models

Fang Yuan, Junjie Zeng, Yue Hu, Zhengqiu Zhu, Quanjun Yin, Yuxiang Xie

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Test Center, National University of Defense Technology(测试中心,国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14218 2025-10-13 cs.CL 89%

Understanding the Repeat Curse in Large Language Models from a Feature Perspective

Junchi Yao, Shu Yang, Jianhua Xu, Lijie Hu, Mengdi Li, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任AI与数据 analytics 实验室) King Abdullah University of Science and Technology(卡瓦尔阿卜杜勒拉大学科学与技术学院) University of Electronic Science and Technology of China(中国电子科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ACL 2025, Findings, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09230 2025-10-13 cs.CV cs.AI cs.CL cs.LG 89%

Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras

Jindong Hong, Wencheng Zhang, Shiqin Qiao, Jianhai Chen, Jianing Qiu, Chuanyang Zheng, Qian Xu, Yun Ji, Qianyue Wen, Weiwei Sun, Hao Li, Huizhen Li, Huichao Wang, Kai Wu, Meng Li, Yijun He, Lingjie Luo, Jiankai Sun

机构 * Bytedance(字节跳动) Peking University(北京大学) Peking University People’s Hospital(北京大学人民医院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05899 2025-10-13 cs.SE 88%

Prompt engineering and its implications on the energy consumption of Large Language Models

Riccardo Rubei, Aicha Moussaid, Claudio di Sipio, Davide di Ruscio

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20854 2025-10-13 cs.SE cs.AI cs.CL 86%

An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks

Xin Zhou, Kisub Kim, Ting Zhang, Martin Weyssow, Luis F. Gomes, Guang Yang, Kui Liu, Xin Xia, David Lo

机构 * Singapore Management University(新加坡国立管理学院) DGIST(韩国高等智能科学研究院) Monash University(墨尔本大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Huawei Software Engineering Application Technology Lab(华为软件工程应用技术实验室) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01860 2025-10-13 cs.SE cs.LG 85%

SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering

Zhimin Zhao

机构 * School of Computing Queen's University Kingston, Canada(计算学院皇后大学加拿大金斯顿)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Check the online arena at https://huggingface.co/spaces/SWE-Arena/Software-Engineering-Arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08604 2025-10-13 cs.IR cs.AI cs.LG stat.ML 84%

Preference Discerning with LLM-Enhanced Generative Retrieval

Fabian Paischer, Liu Yang, Linfeng Liu, Shuai Shao, Kaveh Hassani, Jiacheng Li, Ricky Chen, Zhang Gabriel Li, Xiaoli Gao, Wei Shao, Xue Feng, Nima Noorshams, Sem Park, Bo Long, Hamid Eghbalzadeh

机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT人工智能实验室、机器学习研究所、JKU林茨) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AI at Meta(Meta人工智能)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at TMLR, Code available at https://github.com/facebookresearch/preference_discerning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08602 2025-10-13 cs.CL cs.LG 84%

Human Texts Are Outliers: Detecting LLM-generated Texts via Out-of-distribution Detection

Cong Zeng, Shengkun Tang, Yuanzhou Chen, Zhiqiang Shen, Wenchao Yu, Xujiang Zhao, Haifeng Chen, Wei Cheng, Zhiqiang Xu

机构 * MBZUAI UCLA(加州大学洛杉矶分校) NEC Lab(日本电装实验室)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21447 2025-10-13 cs.CV cs.AI 83%

Multimodal Language Models See Better When They Look Shallower

Haoran Chen, Junyan Lin, Xinghao Chen, Yue Fan, Jianfeng Dong, Xin Jin, Hui Su, Jinlan Fu, Xiaoyu Shen

机构 * Zhejiang Gongshang University(浙江工商大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Institute of Digital Twin, Eastern Institute of Technology, Ningbo(数字孪生研究院,东部技术研究所,宁波) Meituan Inc.(美团公司) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments 9 pages, 6 figures, accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09227 2025-10-13 cs.AI cs.FL 83%

RegexPSPACE: A Benchmark for Evaluating LLM Reasoning on PSPACE-complete Regex Problems

Hyundong Jin, Joonghyuk Hahn, Yo-Sub Han

机构 * Department of Computer Science Yonsei University(计算机科学系延世大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03333 2025-10-13 cs.CV cs.AI 83%

RadVLM: A Multitask Conversational Vision-Language Model for Radiology

Nicolas Deperrois, Hidetoshi Matsuo, Samuel Ruipérez-Campillo, Moritz Vandenhirtz, Sonia Laguna, Alain Ryser, Koji Fujimoto, Mizuho Nishio, Thomas M. Sutter, Julia E. Vogt, Jonas Kluckert, Thomas Frauenfelder, Christian Blüthgen, Farhad Nooralahzadeh, Michael Krauthammer

机构 * Department of Radiology, Kobe University(金泽大学放射科) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Advanced Imaging in Medical Magnetic Resonance, Kyoto University(京都大学医学磁共振高级成像部门) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射科)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.AI

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08776 2025-10-13 cs.CL cs.AI 81%

Measuring Moral LLM Responses in Multilingual Capacities

Kimaya Basu, Savi Kolari, Allison Yu

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures; referenced articles: arXiv:2303.08774, arXiv:2303.12528, arXiv:2308.14132, arXiv:2505.12201, arXiv:2406.04428, arXiv:2407.02273, arXiv:2404.01268, arXiv:2502.09747, arXiv:2507.13474, arXiv:2505.21479, arXiv:2306.05685

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01521 2025-10-13 cs.LG 79%

CarbonX: An Open-Source Tool for Computational Decarbonization Using Time Series Foundation Models

Diptyaroop Maji, Kang Yang, Prashant Shenoy, Ramesh K Sitaraman, Mani Srivastava

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments Update: Corrected PDF rendering error on page 10 (caption of Figure 5 was previously overlapping with paper text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09097 2025-10-13 cs.CL 79%

FrameEOL: Semantic Frame Induction using Causal Language Models

Chihiro Yano, Kosuke Yamada, Hayato Tsukagoshi, Ryohei Sasano, Koichi Takeda

机构 * Nagoya University(名古屋大学) CyberAgent National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted in EMNLP Findings 2025. This version corrects the model size of Table 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09023 2025-10-13 cs.LG cs.CR 79%

The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections

Milad Nasr, Nicholas Carlini, Chawin Sitawarin, Sander V. Schulhoff, Jamie Hayes, Michael Ilie, Juliette Pluto, Shuang Song, Harsh Chaudhari, Ilia Shumailov, Abhradeep Thakurta, Kai Yuanqing Xiao, Andreas Terzis, Florian Tramèr

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) HackAPrompt Northeastern University(东北大学) ETH Zürich(苏黎世联邦理工学院) AI Sequrity Company(AI安全公司) MATS Main contributors(MATS主要贡献者)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04379 2025-10-13 cs.CV cs.LG 79%

VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones

Lefei Shen, Mouxiang Chen, Xu Liu, Han Fu, Xiaoxue Ren, Jianling Sun, Zhuo Li, Chenghao Liu

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) State Street Technology (Zhejiang) Ltd.(State Street Technology(浙江)有限公司) Salesforce Research Asia(Salesforce亚洲研究)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17228 2025-10-13 cs.LG 79%

Automated Capability Evaluation of Foundation Models

Arash Afkanpour, Omkar Dige, Fatemeh Tavakoli, Negin Baghbanzadeh, Farnaz Kohankhaki, Elham Dolatabadi

机构 * Vector Institute(向量研究所) York University(约克大学) Microsoft(微软公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19028 2025-10-13 cs.CL cs.AI cs.CY 79%

Quantifying Fairness in LLMs Beyond Tokens: A Semantic and Statistical Perspective

Weijie Xu, Yiwen Wang, Chi Xue, Xiangkun Hu, Xi Fang, Guimin Dong, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 29 pages, 9 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08671 2025-10-13 cs.AI cs.CL 79%

Optimizing delivery for quick commerce factoring qualitative assessment of generated routes

Milon Bhattacharya, Milan Kumar

机构 * Dept. of Production & Operations Management, IIM Visakhapatnam(生产与运营管理系,IIM维萨卡帕坦姆)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08648 2025-10-13 cs.LG cs.AI 79%

Inverse-Free Wilson Loops for Transformers: A Practical Diagnostic for Invariance and Order Sensitivity

Edward Y. Chang, Ethan Y. Chang

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13933 2025-10-13 cs.NI cs.AI cs.CL cs.IR 79%

Preprint: Poster: Did I Just Browse A Website Written by LLMs?

Sichang Steven He, Ramesh Govindan, Harsha V. Madhyastha

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACM Internet Measurement Conference 2025 Poster & ACM IMC 2025 Student Workshop. 2 pages. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03441 2025-10-13 cs.CV 78%

MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis

Ning Zhu, Xiaochuan Ma, Shaoting Zhang, Guotai Wang

机构 * Ning Zhu 1 Xiaochuan Ma 2 Shaoting Zhang 2,3 Guotai Wang 2,3

专题命中 评测与基准 :foundation model(title,abstract)

Comments 23 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10706 2025-10-13 cs.HC 78%

GestureCoach: Rehearsing for Engaging Talks with LLM-Driven Gesture Recommendations

Ashwin Ram, Varsha Suresh, Artin Saberpour Abadian, Vera Demberg, Jürgen Steimle

专题命中 评测与基准 :LLM(title,abstract)

Comments Accepted at UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08870 2025-10-13 cs.CL 77%

Quality Estimation Reranking for Document-Level Translation

Krzysztof Mrozinski, Minji Kang, Ahmed Khota, Vincent Michael Sutanto, Giovanni Gatti De Giacomo

机构 * Yaraku, Inc(Yaraku公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08612 2025-10-13 cs.SE cs.AI 77%

Impact of LLMs on Team Collaboration in Software Development

Devang Dhanuka

机构 * MS Data Science Program(数据科学项目) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08603 2025-10-13 cs.CL 77%

YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology

Deshui Yu, Yizhi Wang, Saihui Jin, Taojie Zhu, Fanyi Zeng, Wen Qian, Zirui Huang, Jingli Ouyang, Jiameng Li, Zhen Song, Tian Guan, Yonghong He

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) China Unicom Guangdong Branch(中国unicom广东分公司) Department of Network Intelligence, Peng Cheng Laboratory(网络智能系,鹏城实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09361 2025-10-13 cs.CV 75%

BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception

Junyan Ye, Dongzhi Jiang, Jun He, Baichuan Zhou, Zilong Huang, Zhiyuan Yan, Hongsheng Li, Conghui He, Weijia Li

机构 * Sun Yat-sen University(中山大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏