arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-03 至 2025-09-03 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2509.02363 2025-09-03 cs.CL 85%

Towards Temporal Knowledge-Base Creation for Fine-Grained Opinion Analysis with Language Models

Gaurav Negi, Atul Kr. Ojha, Omnia Zayed, Paul Buitelaar

机构 * Insight SFI Research Ireland Centre for Data Analytics, University of Galway(爱尔兰数据分析师中心,Galway大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02666 2025-09-03 cs.CL 85%

A Survey on Progress in LLM Alignment from the Perspective of Reward Design

Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang, Jian Yang, Mark Dras, Usman Naseem

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02198 2025-09-03 cs.CL 85%

FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain

Anum Afzal, Juraj Vladika, Florian Matthes

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01441 2025-09-03 cs.AI cs.MA 85%

LLM-empowered Agents Simulation Framework for Scenario Generation in Service Ecosystem Governance

Deyu Zhou, Yuqi Hou, Xiao Xue, Xudong Lu, Qingzhong Li, Lizhen Cui

机构 * School of Software, Shandong University(软件学院,山东大学) Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(SDU-NTU人工智能研究中心(C-FAIR),山东大学) College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室,天津大学) ShanDa Dareway Software Co. Ltd(山东达瑞软件有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18190 2025-09-03 cs.AI cs.DB cs.IR 85%

ST-Raptor: LLM-Powered Semi-Structured Table Question Answering

Zirui Tang, Boyu Niu, Xuanhe Zhou, Boxiu Li, Wei Zhou, Jiannan Wang, Guoliang Li, Xinyi Zhang, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Simon Fraser University(西蒙弗雷泽大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Extension of our SIGMOD 2026 paper. Please refer to source code available at: https://github.com/weAIDB/ST-Raptor

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00273 2025-09-03 cs.CL 85%

Echoes in AI: Quantifying lack of plot diversity in LLM outputs

Weijia Xu, Nebojsa Jojic, Sudha Rao, Chris Brockett, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments PNAS Vol. 122 No. 35. Copyright \c{opyright} 2025 the Author(s). Published by PNAS. This open access article is distributed under Creative Commons Attribution-NonCommercial-NoDerivatives License 4.0 (CC BY-NC-ND)

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (35) e2504966122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01590 2025-09-03 q-fin.CP 85%

Is All the Information in the Price? LLM Embeddings versus the EMH in Stock Clustering

Bingyang Wang, Grant Johnson, Maria Hybinette, Tucker Balch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 5 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01460 2025-09-03 cs.HC 85%

Dissecting Atomic Facts: Visual Analytics for Improving Fact Annotations in Language Model Evaluation

Manuel Schmidt, Daniel A. Keim, Frederik L. Dennig

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 2 pages text plus poster, 2 figures, LaTeX

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02330 2025-09-03 cs.SE cs.AI 83%

ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation

Yicong Zhao, Shisong Chen, Jiacheng Zhang, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai Institute of Artificial Intelligence for Education(教育人工智能研究所) East China Normal University(华东师范大学) School of Information, Renmin University of China(信息学院,中国人民大学) School of Smart Governance, Renmin University of China(智能治理学院,中国人民大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00069 2025-09-03 cs.LG 83%

AnomalyExplainer Explainable AI for LLM-based anomaly detection using BERTViz and Captum

Prasasthy Balasubramanian, Dumindu Kankanamge, Ekaterina Gilman, Mourad Oussalah

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07268 2025-09-03 cs.MM cs.CL cs.CV 83%

Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation

Jinyuan Li, Ziyan Li, Han Li, Jianfei Yu, Rui Xia, Di Sun, Gang Pan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) NJUST(南京理工大学) College of Mathematics, Taiyuan University of Technology(数学学院,太原科技大学) Tianjin University of Science and Technology(天津科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Extension of our Findings of EMNLP 2023 & ACL 2024 paper, IEEE Transactions on Multimedia accepted on July 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00728 2025-09-03 cs.IR cs.DB 82%

A Survey on Open Dataset Search in the LLM Era: Retrospectives and Perspectives

Pengyue Li, Sheng Wang, Hua Dai, Zhiyu Chen, Zhifeng Bao, Brian D. Davison

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01772 2025-09-03 cs.CL cs.AI 81%

chDzDT: Word-level morphology-aware language model for Algerian social media text

Abdelkrime Aries

机构 * Laboratoire de la Communication dans les Systèmes Informatiques, Ecole Nationale Supérieure d’Informatique(信息通信系统通信实验室,国家高等信息学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01554 2025-09-03 cs.CV cs.AI cs.LG 81%

Unified Supervision For Vision-Language Modeling in 3D Computed Tomography

Hao-Chih Lee, Zelong Liu, Hamza Ahmed, Spencer Kim, Sean Huver, Vishwesh Nath, Zahi A. Fayad, Timothy Deyer, Xueyan Mei

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

Comments ICCV 2025 VLM 3d Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01790 2025-09-03 cs.CL cs.AI cs.LG 80%

Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs

Andong Hua, Kenan Tang, Chenhe Gu, Jindong Gu, Eric Wong, Yao Qin

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Irvine(加州大学伊尔弗雷德分校) University of Oxford(牛津大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02730 2025-09-03 cs.CV cs.CL cs.RO 79%

DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes

Zhaowei Wang, Hongming Zhang, Tianqing Fang, Ye Tian, Yue Yang, Kaixin Ma, Xiaoman Pan, Yangqiu Song, Dong Yu

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Lab(腾讯AI实验室) Robotics X, Tencent(腾讯机器人实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00849 2025-09-03 cs.CL 79%

Prompting Away Stereotypes? Evaluating Bias in Text-to-Image Models for Occupations

Shaina Raza, Maximus Powers, Partha Pratim Saha, Mahveen Raza, Rizwan Qureshi

专题命中 评测与基准 :prompting(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09698 2025-09-03 cs.RO cs.AI 79%

ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation

Enyu Zhao, Vedant Raval, Hejia Zhang, Jiageng Mao, Zeyu Shangguan, Stefanos Nikolaidis, Yue Wang, Daniel Seita

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Conference on Robot Learning (CoRL) 2025. 50 pages and 30 figures. v2 is the camera-ready and includes a few more new experiments compared to v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12989 2025-09-03 cs.CL cs.IR 79%

Into the crossfire: evaluating the use of a language model to crowdsource gun violence reports

Adriano Belisario, Scott A. Hale, Luc Rocher

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所、牛津大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04078 2025-09-03 cs.CL cs.AI 79%

LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation

Ming Zhang, Yujiong Shen, Zelin Li, Huayu Sha, Binze Hu, Yuhui Wang, Chenhao Huang, Shichun Liu, Jingqi Tong, Changhao Jiang, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) Shanghai AI Laboratory(上海人工智能实验室) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01071 2025-09-03 cs.CV 78%

A Unified Low-level Foundation Model for Enhancing Pathology Image Quality

Ziyi Liu, Zhe Xu, Jiabo Ma, Wenqaing Li, Junlin Hou, Fuxiang Huang, Xi Wang, Ronald Cheong Kin Chan, Terence Tsz Wai Wong, Hao Chen

机构 * Department of Computer Science Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科技大学) Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong(解剖学与细胞病理学系,香港中文大学) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(化学与生物工程系,香港科技大学) Division of Life Science, Hong Kong University of Science and Technology(生命科学系,香港科技大学) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00026 2025-09-03 cs.LG cs.CY 77%

Diagnosing Psychiatric Patients: Can Large Language and Machine Learning Models Perform Effectively in Emergency Cases?

Abu Shad Ahammed, Sayeri Mukherjee, Roman Obermaisser

机构 * Chair of Embedded Systems University of Siegen(嵌入系统系 绍林大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19720 2025-09-03 cs.CL 77%

Continuously Steering LLMs Sensitivity to Contextual Knowledge with Proxy Models

Yilin Wang, Heng Wang, Yuyang Bai, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments emnlp 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02518 2025-09-03 cs.LG 77%

AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs

Yao Lai, Souradip Poddar, Sungyoung Lee, Guojin Chen, Mengkang Hu, Bei Yu, Ping Luo, David Z. Pan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01199 2025-09-03 eess.SY cs.SY 75%

IndusGCC: A Data Benchmark and Evaluation Framework for GUI-Based General Computer Control in Industrial Automation

Xiaoran Yang, Yuyang Du, Kexin Chen, Soung Chang Liew, Jiamin Lu, Ziyu Guo, Xiaoyan Liu, Qun Yang, Shiqi Xu, Xingyu Fan, Yuchen Pan, Taoyong Cui, Hongyu Deng, Boris Dudder, Jianzhang Pan, Qun Fang, Pheng Ann Heng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21188 2025-09-03 cs.LG cs.CL 73%

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

Haoze Wu, Cheng Wang, Wenshuo Zhao, Junxian He

机构 * Zhejiang University(浙江大学) National University of Singapore(国立新加坡大学) HKUST(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01620 2025-09-03 cs.CL cs.AI 73%

Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry

Shanshan Wang, Junchao Wu, Fengying Ye, Jingming Yao, Lidia S. Chao, Derek F. Wong

机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学) Department of Portuguese, Faculty of Arts and Humanities, University of Macau(文学与人文学院,澳门大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02037 2025-09-03 cs.CL cs.AI 73%

FinS-Pilot: A Benchmark for Online Financial RAG System

Feng Wang, Yiding Sun, Jiaxin Mao, Wei Xue, Danqing Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) Tencent Inc.(腾讯公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11614 2025-09-03 cs.CL cs.AI 73%

Intrinsic Test of Unlearning Using Parametric Knowledge Traces

Yihuai Hong, Lei Yu, Haiqin Yang, Shauli Ravfogel, Mor Geva

机构 * New York University(纽约大学) University of Toronto(多伦多大学) International Digital Economy Academy (IDEA), China(国际数字经济学院(IDEA)) Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00654 2025-09-03 cs.SD cs.AI cs.LG cs.MM eess.AS 73%

The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation

Ashwin Nagarajan, Hao-Wen Dong

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏