arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-11 至 2025-11-11 共收录 355 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 89 篇

2511.03248 2025-11-11 cs.CR 75%

Auditing M-LLMs for Privacy Risks: A Synthetic Benchmark and Evaluation Framework

Junhao Li, Jiahao Chen, Zhou Feng, Chunyi Zhou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 14 pages, 3 figures; Accepted by MMM 2026; Complete version in progress. Dataset available at https://huggingface.co/datasets/xaddh/multimodal-privacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14422 2025-11-11 cs.SI 75%

MindVote: When AI Meets the Wild West of Social Media Opinion

Xutao Mao, Ezra Xuanru Tao, Leyao Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted in AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05586 2025-11-11 cs.LG 74%

Prompting Neural-Guided Equation Discovery Based on Residuals

Jannis Brugger, Viktor Pfanschilling, David Richter, Mira Mezini, Stefan Kramer

机构 * Technical University of Darmstadt(德累斯顿技术大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Johannes Gutenberg-Universität Mainz(美因茨约翰内斯·古腾堡大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 评测与基准 :prompting(title);分类 cs.LG

Comments 16 pages, 7 figures, Discovery Science 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06519 2025-11-11 q-bio.NC cs.AI cs.CL 73%

On the Analogy between Human Brain and LLMs: Spotting Key Neurons in Grammar Perception

Sanaz Saki Norouzi, Mohammad Masjedi, Pascal Hitzler

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14395 2025-11-11 cs.CL cs.AI 73%

MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language

Seyoung Song, Seogyeong Jeong, Eunsu Kim, Jiho Jin, Dongkwan Kim, Jay Shin, Alice Oh

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To appear in Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21382 2025-11-11 cs.CL cs.AI 73%

Normality and the Turing Test

Alexandre Kabbach

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21228 2025-11-11 cs.CL cs.AI 73%

ECLeKTic: a Novel Challenge Set for Evaluation of Cross-Lingual Knowledge Transfer

Omer Goldman, Uri Shaham, Dan Malkin, Sivan Eiger, Avinatan Hassidim, Yossi Matias, Joshua Maynez, Adi Mayrav Gilady, Jason Riesa, Shruti Rijhwani, Laura Rimell, Idan Szpektor, Reut Tsarfaty, Matan Eyal

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05390 2025-11-11 cs.CL cs.LG 73%

Learning Task Representations from In-Context Learning

Baturay Saglam, Xinyang Hu, Zhuoran Yang, Dionysis Kalogerias, Amin Karbasi

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07077 2025-11-11 cs.CL 70%

EmoBang: Detecting Emotion From Bengali Texts

Abdullah Al Maruf, Aditi Golder, Zakaria Masud Jiyad, Abdullah Al Numan, Tarannum Shaila Zaman

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06890 2025-11-11 cs.CL 70%

EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers

Yilin Jiang, Mingzi Zhang, Xuanyu Yin, Sheng Jin, Suyu Lu, Zuocan Ying, Zengyi Yu, Xiangjie Kong

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 22 pages, 9 figures, accepted by AAAI2026 as oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04307 2025-11-11 cs.AI 70%

GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents

Jian Mu, Chaoyun Zhang, Chiming Ni, Lu Wang, Bo Qiao, Kartik Mathur, Qianhui Wu, Yuhang Xie, Xiaojun Ma, Mengyu Zhou, Si Qin, Liqun Li, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Nanjing University(南京大学) Microsoft(微软) ZJU-UIUC(浙大-UIUC) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06418 2025-11-11 cs.CL 70%

How Well Do LLMs Understand Drug Mechanisms? A Knowledge + Reasoning Evaluation Dataset

Sunil Mohan, Theofanis Karaletsos

机构 * CZI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments An earlier version of this paper appears in IEEE FLLM 2025. GitHub: https://github.com/czi-ai/DrugMechCounterfactuals

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06417 2025-11-11 cs.AI 70%

AUTO-Explorer: Automated Data Collection for GUI Agent

Xiangwu Guo, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05626 2025-11-11 cs.SE cs.AI cs.DC 70%

LLMs as Packagers of HPC Software

Caetano Melone, Daniel Nichols, Konstantinos Parasyris, Todd Gamblin, Harshitha Menon

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07315 2025-11-11 q-fin.ST cs.AI 70%

Towards Competent AI for Fundamental Analysis in Finance: A Benchmark Dataset and Evaluation

Zonghan Wu, Congyuan Zou, Junlin Wang, Chenhan Wang, Hangjing Yang, Yilei Shao

机构 * Shanghai AI Finance School, East China Normal University(上海人工智能金融学院,华东师范大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 70%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01894 2025-11-11 cs.CV cs.AI cs.HC 70%

LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces

Rashid Mushkani, Shravan Nayak, Hugo Berard, Allison Cohen, Shin Koseki, Hadrien Bertrand

机构 * Mila–Quebec AI Institute(魁北克AI研究所)

专题命中 评测与基准 :LLM(abstract);preference optimization(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06892 2025-11-11 cs.RO 67%

Multi-Agent AI Framework for Road Situation Detection and C-ITS Message Generation

Kailin Tong, Selim Solmaz, Kenan Mujkic, Gottfried Allmer, Bo Leng

机构 * Virtual Vehicle Research GmbH(虚拟车辆研究有限公司) ASFINAG Maut Service GmbH(ASFINAG收费服务有限公司) Tongji University(同济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments submitted to TRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06360 2025-11-11 cs.CV 67%

AesTest: Measuring Aesthetic Intelligence from Perception to Production

Guolong Wang, Heng Huang, Zhiqiang Zhang, Wentian Li, Feilong Ma, Xin Jin

机构 * University of International Business and Economics(国际商务经济大学) University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd(华为技术有限公司) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06281 2025-11-11 cs.CV 67%

VideoSSR: Video Self-Supervised Reinforcement Learning

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06259 2025-11-11 cs.LG cs.AI 62%

Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra

Yiwen Zhang, Keyan Ding, Yihang Wu, Xiang Zhuang, Yi Yang, Qiang Zhang, Huajun Chen

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06125 2025-11-11 cs.CL cs.AI cs.IR 62%

Evaluation of retrieval-based QA on QUEST-LOFT

Nathan Scales, Nathanael Schärli, Olivier Bousquet

机构 * Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05500 2025-11-11 cs.IR cs.AI cs.CL 62%

Predicting Oscar-Nominated Screenplays with Sentence Embeddings

Francis Gross

机构 * Faculty of Informatics and Data Science(信息学与数据科学学院) University of Regensburg(雷根萨大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00903 2025-11-11 cs.LG cs.AI cs.NE 62%

Universal Neurons in GPT-2: Emergence, Persistence, and Functional Impact

Advey Nandan, Cheng-Ting Chou, Amrit Kurakula, Cole Blondin, Kevin Zhu, Vasu Sharma, Sean O'Brien

机构 * University of Waterloo(滑铁卢大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Ottawa University(渥太华大学) Algoverse(Algoverse公司) Meta FAIR Lab(Meta FAIR实验室) UCSD(加州大学圣地亚哥分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07186 2025-11-11 cs.CL cs.LG 62%

PCS: Perceived Confidence Scoring of Black Box LLMs with Metamorphic Relations

Sina Salimian, Gias Uddin, Shaina Raza, Henry Leung

机构 * University of Calgary(卡尔加里大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07298 2025-11-11 cs.CV cs.AI 57%

LMM-IQA: Image Quality Assessment for Low-Dose CT Imaging

Kagan Celik, Mehmet Ozan Unal, Metin Ertas, Isa Yildirim

机构 * Department of Electronics and Communication Engineering, Istanbul Technical University(电子与通信工程系,伊斯坦布尔技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07010 2025-11-11 cs.CL cs.CV cs.HC 57%

A Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation

Siddharth Betala, Kushan Raj, Vipul Betala, Rohan Saswade

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted at The 12th Workshop on Asian Translation, co-located with IJCLNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06619 2025-11-11 cs.RO cs.AI 57%

How Do VLAs Effectively Inherit from VLMs?

Chuheng Zhang, Rushuai Yang, Xiaoyu Chen, Kaixin Wang, Li Zhao, Yi Chen, Jiang Bian

机构 * Microsoft Research(微软研究院) The Hong Kong University of Science(香港科学大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18551 2025-11-11 cs.AI 57%

SOCIA-Nabla: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation

Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments superseded by newest version of arXiv:2505.12006

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19012 2025-11-11 cs.RO cs.AI 57%

Pure Vision Language Action (VLA) Models: A Comprehensive Survey

Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou

机构 * Lanzhou University, China(兰州大学) National University of Singapore, Singapore(新加坡国立大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏