arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-17 至 2025-09-17 共收录 177 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2509.12961 2025-09-17 cs.CL 70%

Do LLMs Understand Wine Descriptors Across Cultures? A Benchmark for Cultural Adaptations of Wine Reviews

Chenye Zou, Xingyue Wen, Tianyi Hu, Qian Janice Wang, Daniel Hershcovich

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Department of Food and Resource Economics, University of Copenhagen(哥本哈根大学食品与资源经济学系) Department of Food Science, University of Copenhagen(哥本哈根大学食品科学系) Department of Computer Science, Aarhus University(阿arhus大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12612 2025-09-17 cs.AI 70%

GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL

Daojun Chen, Xi Wang, Shenyuan Ren, Qingzhi Ma, Pengpeng Zhao, An Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12340 2025-09-17 cs.CL 70%

MTEB-NL and E5-NL: Embedding Benchmark and Models for Dutch

Nikolay Banar, Ehsan Lotfi, Jens Van Nooten, Cristina Arhiliuc, Marija Kliocaite, Walter Daelemans

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10105 2025-09-17 cs.CV cs.CL 70%

VARCO-VISION-2.0 Technical Report

Young-rok Cha, Jeongho Ju, SunYoung Park, Jong-Hyeon Lee, Younghyun Yu, Youngjune Kim

机构 * NC AI

专题命中 评测与基准 :language model(abstract);preference optimization(abstract);分类 cs.CL

Comments 19 pages, 1 figure, 14 tables. Technical report for VARCO-VISION-2.0, a Korean-English bilingual VLM in 14B and 1.7B variants. Key features: multi-image understanding, OCR with text localization, improved Korean capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17962 2025-09-17 cs.CL 70%

Crafting Customisable Characters with LLMs: A Persona-Driven Role-Playing Agent Framework

Bohao Yang, Dong Liu, Chenghao Xiao, Kun Zhao, Chen Tang, Chao Li, Lin Yuan, Guang Yang, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Tencent Timi Studio(腾讯TIMI工作室) Durham University(杜伦大学) University of Pittsburgh(匹兹堡大学) University of Surrey(萨里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20890 2025-09-17 cs.CR 67%

PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance

Mengxiao Wang, Yuxuan Zhang, Guofei Gu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17539 2025-09-17 cs.SE 67%

Breaking Single-Tester Limits: Multi-Agent LLMs for Multi-User Feature Testing

Sidong Feng, Changhao Du, Huaxiao Liu, Qingnan Wang, Zhengwei Lv, Mengfei Wang, Chunyang Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to International Conference on Software Engineering (ICSE 2026). arXiv admin note: substantial text overlap with arXiv:2504.15474

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13160 2025-09-17 cs.LG cs.AI 62%

FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning

Liang Hu, Jianpeng Jiao, Jiashuo Liu, Yanle Ren, Zhoufutu Wen, Kaiyuan Zhang, Xuanliang Zhang, Xiang Gao, Tianci He, Fei Hu, Yali Liao, Zaiyuan Wang, Chenghao Yang, Qianyu Yang, Mingren Yin, Zhiyuan Zeng, Ge Zhang, Xinyi Zhang, Xiying Zhao, Zhenwei Zhu, Hongseok Namkoong, Wenhao Huang, Yuwen Tang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01132 2025-09-17 cs.CL cs.AI 62%

Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding

Melanie Subbiah, Akankshya Mishra, Grace Kim, Liyan Tang, Greg Durrett, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12927 2025-09-17 cs.AI cs.CV cs.GT cs.LG cs.MA 62%

HLSMAC: A New StarCraft Multi-Agent Challenge for High-Level Strategic Decision-Making

Xingxing Hong, Yungong Wang, Dexin Jin, Ye Yuan, Ximing Huang, Zijian Wu, Wenxin Li

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 13 figures with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12512 2025-09-17 eess.IV cs.AI cs.CV 61%

DinoAtten3D: Slice-Level Attention Aggregation of DinoV2 for 3D Brain MRI Anomaly Classification

Fazle Rafsani, Jay Shah, Catherine D. Chong, Todd J. Schwedt, Teresa Wu

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic, Arizona(梅奥诊所(亚利桑那))

专题命中 评测与基准 :foundation model(abstract,comments);分类 cs.AI

Comments ACCEPTED at the ICCV 2025 Workshop on Anomaly Detection with Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14335 2025-09-17 cs.CL 57%

References Matter: Investigating the Impact of Reference Set Variation on Summarization Evaluation

Silvia Casola, Yang Janet Liu, Siyao Peng, Oliver Kraus, Albert Gatt, Barbara Plank

机构 * MaiNLP, LMU Munich(LMU慕尼黑人工智能实验室) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心) Department of Linguistics, University of Pittsburgh, USA(匹兹堡大学语言学系) NLP Group, Department of Information and Computing Sciences, Utrecht University, Netherlands(乌得勒支大学信息与计算科学系自然语言处理组)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01419 2025-09-17 cs.CL 57%

UniversalCEFR: Enabling Open Multilingual Research on Language Proficiency Assessment

Joseph Marvin Imperial, Abdullah Barayan, Regina Stodden, Rodrigo Wilkens, Ricardo Munoz Sanchez, Lingyun Gao, Melissa Torgbi, Dawn Knight, Gail Forey, Reka R. Jablonkai, Ekaterina Kochmar, Robert Reynolds, Eugénio Ribeiro, Horacio Saggion, Elena Volodina, Sowmya Vajjala, Thomas François, Fernando Alva-Manchego, Harish Tayyar Madabushi

机构 * University of Bath(巴斯大学) Cardiff University(卡迪夫大学) National University Philippines(菲律宾国家大学) Bielefeld University(比勒菲尔德大学) University of Exeter(埃克塞特大学) University of Gothenburg(哥德堡大学) UCLouvain(列日大学) MBZUAI(马克斯·普朗克智能系统研究所) Brigham Young University(Brigham Young 大学) INESC-ID Lisboa(里斯本 INESC-ID) Instituto Universitário de Lisboa (ISCTE-IUL)(里斯本大学学院(ISCTE-IUL)) Universitat Pompeu Fabra(庞培法华大学) National Research Council, Canada(加拿大国家研究委员会) King Abdulaziz University(国王阿卜杜勒-阿齐兹大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13289 2025-09-17 cs.CV eess.IV 50%

Image Realness Assessment and Localization with Multimodal Features

Lovish Kaushik, Agnij Biswas, Somdyuti Paul

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈拉格普)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13181 2025-09-17 cs.CV 50%

Road Obstacle Video Segmentation

Shyam Nandan Rai, Shyamgopal Karthik, Mariana-Iuliana Georgescu, Barbara Caputo, Carlo Masone, Zeynep Akata

机构 * Politecnico di Torino(都灵理工大学) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑 Helmholtz 中心) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 评测与基准 :foundation model(abstract)

Comments GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02556 2025-09-17 cs.RO 50%

Sign Language: Towards Sign Understanding for Robot Autonomy

Ayush Agrawal, Joel Loo, Nicky Zimmerman, David Hsu

机构 * Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所) Northeastern University(东北大学)

专题命中 评测与基准 :language model(abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 37 篇

2506.02153 2025-09-17 cs.AI 91%

Small Language Models are the Future of Agentic AI

Peter Belcak, Greg Heinrich, Shizhe Diao, Yonggan Fu, Xin Dong, Saurav Muralidharan, Yingyan Celine Lin, Pavlo Molchanov

机构 * NVIDIA Research(NVIDIA研究)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16393 2025-09-17 cs.AI cs.CL cs.LG 90%

Concurrent Linguistic Error Detection (CLED): a New Methodology for Error Detection in Large Language Models

Jinhua Zhu, Javier Conde, Zhen Gao, Pedro Reviriego, Shanshan Liu, Fabrizio Lombardi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 6 figures, 30 references

Journal ref IEEE Transactions on Computers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20404 2025-09-17 cs.CL cs.LG 90%

JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution

Yurui Chang, Bochuan Cao, Yujia Wang, Jinghui Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12754 2025-09-17 cs.RO cs.AI cs.HC cs.LG 90%

Toward Ownership Understanding of Objects: Active Question Generation with Large Language Model and Probabilistic Generative Model

Saki Hashimoto, Shoichi Hasegawa, Tomochika Ishikawa, Akira Taniguchi, Yoshinobu Hagiwara, Lotfi El Hafi, Tadahiro Taniguchi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Submitted to AROB-ISBC 2026 (Journal Track option)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03107 2025-09-17 cs.AI 89%

CredID: Credible Multi-Bit Watermark for Large Language Models Identification

Haoyu Jiang, Xuhong Wang, Ping Yi, Shanzhe Lei, Yilun Lin

机构 * School of Cyber Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10178 2025-09-17 cs.AR cs.LG 89%

Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving

Wonung Kim, Yubin Lee, Yoonsung Kim, Jinwoo Hwang, Seongryong Oh, Jiyong Jung, Aziz Huseynov, Woong Gyu Park, Chang Hyun Park, Divya Mahajan, Jongse Park

机构 * Uppsala University(乌普萨拉大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Journal ref MICRO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13745 2025-09-17 cs.CL cs.AI cs.CR cs.LG stat.ML 89%

Context-Aware Membership Inference Attacks against Pre-trained Large Language Models

Hongyan Chang, Ali Shahin Shamsabadi, Kleomenis Katevas, Hamed Haddadi, Reza Shokri

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) Brave Software(Brave软件公司) Imperial College London(帝国理工学院) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12221 2025-09-17 cs.LG cs.AI cs.CL cs.CR 89%

MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors

Xin Tong, Zhi Lin, Jingya Wang, Meng Han, Bo Jin

机构 * Xin Tong School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Zhi Lin School of Safety Science Tsinghua University(安全科学学院 清华大学) Jingya Wang School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Meng Han Intelligent Fusion Research Center Zhejiang University(智能融合研究中心 浙江大学) Bo Jin* The Third Research Institute of the Ministry of Public Security of China(中华人民共和国公安部第三研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12521 2025-09-17 cs.LG 88%

Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time

Yifan Lan, Yuanpu Cao, Weitong Zhang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13265 2025-09-17 cs.CY 88%

Beyond Private or Public: Large Language Models as Quasi-Public Goods in the AI Economy

Yukun Zhang, TianYang Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13244 2025-09-17 cs.CL 87%

Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12886 2025-09-17 cs.CL cs.AI 86%

The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations

Yubo Zhu, Dongrui Liu, Zecheng Lin, Wei Tong, Sheng Zhong, Jing Shao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13179 2025-09-17 cs.IR cs.LG 85%

Efficient Cold-Start Recommendation via BPE Token-Level Embedding Initialization with LLM

Yushang Zhao, Xinyue Han, Qian Leng, Qianyi Sun, Haotian Lyu, Chengrui Zhou

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12211 2025-09-17 cs.DC cs.AI 85%

TinyServe: Query-Aware Cache Selection for Efficient LLM Serving

Dong Liu, Yanxuan Yu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to ACM MM as Oral Paper, also accepted to ICML MOSS workshop, publicly available as https://openreview.net/forum?id=sOdtl4jLci

详情

展开后加载摘要…

URL PDF HTML 收藏