arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2511.11914 2026-01-21 cs.AI cs.CL cs.CR cs.IT cs.LG math.IT 87%

Forgetting-MarI: LLM Unlearning via Marginal Information Regularization

Forgetting-MarI: 通过边际信息正则化实现LLM反训练

Shizhou Xu, Yuan Ni, Stefan Broecker, Thomas Strohmer

机构 * Department of Mathematics, University of California Davis, USA(加州大学戴维斯分校数学系) SLAC National Accelerator Laboratory, Stanford University, USA(斯坦福大学SLAC国家加速器实验室) Department of Computer Science, University of California Davis, USA(加州大学戴维斯分校计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Forgetting-MarI通过边际信息正则化实现LLM反训练,有效移除冗余信息并保留关键知识,提升模型可控性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06884 2026-01-13 cs.CL cs.AI cs.LG 87%

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

对LLM-as-a-Reviewer的改写对抗攻击

Masahiro Kaneko

机构 * MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12869 2026-01-05 cs.CL cs.AI cs.LG 87%

Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators

通过多个评估者实现语言模型无环偏好评估

Zhengyu Hu, Jieyu Zhang, Zhihan Xiong, Alexander Ratner, Kaize Ding, Ranjay Krishna

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PGED通过多个评估者构建偏好图并去噪,解决LLM偏好评估中的循环问题,提升评估可靠性与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20022 2025-12-24 cs.IR 87%

LLM-Assisted Abstract Screening with OLIVER: Evaluating Calibration and Single-Model vs. Actor-Critic Configurations in Literature Reviews

基于OLIVER的LLM辅助摘要筛选:评估文献综述中的校准性和单模型与Actor-Critic配置

Kian Godhwani, David Benrimoh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OLIVER框架,评估LLM在文献综述中的校准性和单模型与Actor-Critic配置效果,发现后者在提高区分性和减少校准误差方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19238 2025-12-23 cs.CL cs.AI cs.LG 87%

Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation

识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施

Anna-Maria Gueorguieva, Aylin Caliskan

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17638 2025-12-23 cs.AI cs.CL cs.LG 87%

LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena

LLM-as-a-Prophet: 通过Prophet Arena理解预测智能

Qingchuan Yang, Simon Mahns, Sida Li, Anri Gu, Jibang Wu, Haifeng Xu

机构 * University of Southern California(南加州大学) Meta The University of Chicago(芝加哥大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Prophet Arena评估了LLMs在预测任务中的表现,揭示了其预测能力及存在的瓶颈。

Comments https://www.prophetarena.co/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13857 2025-12-18 cs.AI cs.CL cs.LG cs.MA cs.NE 87%

EvoLattice: Persistent Internal-Population Evolution through Multi-Alternative Quality-Diversity Graph Representations for LLM-Guided Program Discovery

EvoLattice: 通过多替代质量-多样性图表示实现持久内部种群进化以指导LLM引导的程序发现

Kamer Ali Yuksel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoLattice通过多替代质量-多样性图表示实现持久内部种群进化,提升LLM引导程序发现的稳定性、表达力和改进轨迹

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04842 2025-12-11 cs.HC 87%

Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction

图表思维:通过结构化数据提取提升大语言模型的可视化素养

Amit Kumar Das, Mohammad Tarun, Klaus Mueller

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过结构化数据提取方法,图表思维显著提升了大语言模型在可视化任务上的表现,使其超越人类基准,同时为复杂视觉解释任务提供了新的基准。

Comments 11 pages, 8 figures. Accepted at IEEE VIS: Visualization & Visual Analytics 2025 conference, November 2-7, 2025, Vienna, Austria

Journal ref IEEE Transactions on Visualization and Computer Graphics (TVCG), PrePrints 5555, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05156 2025-12-09 cs.AI cs.CL cs.IT cs.LG math.IT q-fin.CP 87%

Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations

语义忠实与熵产度量:驯服LLM恶魔并管理幻觉

Igor Halperin

机构 * Fidelity Investments

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义忠实与熵产度量,通过信息论和热力学方法评估LLM的忠实度并控制幻觉,应用于公司SEC文件摘要生成。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06504 2025-12-09 cs.CR 87%

When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation

当代码跨越国界:一种以安全为中心的LLM代码翻译研究

Hailong Chang, Guozhu Meng, Shuhui Xiao, Kai Chen, Kun Sun, Yilin Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在代码翻译中的安全风险,发现28.6%-45%的翻译引入新漏洞,并提出RAG策略降低漏洞率32.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02914 2025-12-03 cs.AI cs.CL cs.LG 87%

Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning

马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准

Zhonghao He, Tianyi Qiu, Hirokazu Shirado, Maarten Sap

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12792 2025-12-03 cs.LG cs.AI cs.CL stat.ML 87%

Bridging Human and LLM Judgments: Understanding and Narrowing the Gap

弥合人类与大语言模型判断之间的鸿沟:理解和缩小差距

Felipe Maia Polo, Xinhe Wang, Mikhail Yurochkin, Gongjun Xu, Moulinath Banerjee, Yuekai Sun

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) Institute of Foundation Models, MBZUAI(基础模型研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Bridge通过统一统计框架弥合人类与LLM判断差距,改进评分并揭示系统性差异。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 87%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20604 2025-11-26 cs.CL cs.AI cs.LG 87%

On Evaluating LLM Alignment by Evaluating LLMs as Judges

通过评估LLM作为裁判来评估LLM对齐

Yixin Liu, Pengfei Liu, Arman Cohan

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。

Comments NeurIPS 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18403 2025-11-25 cs.CY 87%

UnWEIRDing LLM Entity Recommendations

去WEIRD化LLM实体推荐

Aayush Kumar, Sanket Mhatre

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在现实世界实体推荐中的文化偏见,通过WEIRD框架评估并应用多元提示策略以减轻偏见,发现不同模型的偏见减轻效果不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23799 2025-11-25 cs.CL cs.AI cs.HC cs.LG 87%

Estimating LLM Consistency: A User Baseline vs Surrogate Metrics

估计LLM一致性:用户基准与替代指标

Xiaoyuan Wu, Weiran Lin, Omer Akgul, Lujo Bauer

机构 * Carnegie Mellon University(卡内基梅隆大学) RSAC Labs(RSAC实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于logits的集成方法,用于估计LLM一致性,并展示了其在匹配人类评分方面与现有最佳指标相当。

Comments Published as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15030 2025-11-20 eess.SP 87%

WiCo-PG: Wireless Channel Foundation Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Ziwei Huang, Xuesong Cai, Xiang Cheng, Jianjun Wu

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13907 2025-11-19 cs.DB 87%

SQL-to-Text Generation with Weighted-AST Few-Shot Prompting

Sriom Chakrabarti, Chuangtao Ma, Arijit Khan, Sebastian Link

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15902 2025-11-19 cs.LG cs.AI cs.CL 87%

IPAD: Inverse Prompt for AI Detection - A Robust and Interpretable LLM-Generated Text Detector

Zheng Chen, Yushi Feng, Jisheng Dang, Yue Deng, Changyang He, Hongxi Pu, Haoxuan Li, Bo Li

机构 * Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算机科学与数据科学学院) School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院) Max Planck Institute for Security and Privacy(安全与隐私研究所) Computer Science, The University of Michigan(密歇根大学计算机科学系) Center for Data Science, Peking University(北京大学数据科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21359 2025-11-19 cs.CL cs.AI cs.CY cs.LG econ.GN q-fin.EC 87%

Can Machines Think Like Humans? A Behavioral Evaluation of LLM Agents in Dictator Games

Ji Ma

机构 * Gradel Institute of Charity, New College, University of Oxford(格拉德学院,牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10667 2025-11-17 cs.CL cs.AI cs.LG 87%

Evaluating LLM Understanding via Structured Tabular Decision Simulations

Sichao Li, Xinyue Xu, Xiaomeng Li

机构 * City University of Macau(澳门城市大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08500 2025-11-12 cs.CL cs.AI cs.LG math.SP 87%

SPEAR-MM: Selective Parameter Evaluation and Restoration via Model Merging for Efficient Financial LLM Adaptation

Berkcan Kapusuzoglu, Supriyo Chakraborty, Renkun Ni, Stephen Rawls, Sambit Sahu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08060 2025-11-12 cs.CR cs.SE 87%

From LLMs to Agents: A Comparative Evaluation of LLMs and LLM-based Agents in Security Patch Detection

Junxiao Han, Zheng Yu, Lingfeng Bao, Jiakun Liu, Yao Wan, Jianwei Yin, Shuiguang Deng, Song Han

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18835 2025-11-05 cs.SE 87%

AUCAD: Automated Construction of Alignment Dataset from Log-Related Issues for Enhancing LLM-based Log Generation

Hao Zhang, Dongjun Yu, Lei Zhang, Guoping Rong, Yongda Yu, Haifeng Shen, He Zhang, Dong Shao, Hongyu Kuang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments In the 16th International Conference on Internetware 2025. 13 pages

Journal ref Proceedings of the 16th International Conference on Internetware (2025) 413-425

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07759 2025-10-28 cs.IR 87%

A Survey of Long-Document Retrieval in the PLM and LLM Era

Minghan Li, Miyang Luo, Tianrui Lv, Yishuai Zhang, Siqi Zhao, Ercong Nie, Guodong Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11593 2025-10-28 cs.CV cs.AI cs.CL cs.DB cs.LG 87%

Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion

Luigi Celona, Simone Bianco, Marco Donzella, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication(信息学、系统与通信系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This manuscript has been accepted for publication in Springer Neural Computing and Applications

Journal ref Neural Computer & Application 37, 27279-27299 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20810 2025-10-24 cs.CL cs.AI cs.CY cs.LG 87%

On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text?

Mingmeng Geng, Thierry Poibeau

机构 * École Normale Supérieure (ENS) - Université Paris Sciences et Lettres (PSL)(巴黎 sciences et lettres 大学(PSL)- 法国规范大学(ENS)) Laboratoire Lattice (CNRS, ENS-PSL, Université Sorbonne Nouvelle)(晶格实验室(CNRS、ENS-PSL、索邦大学))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24379 2025-10-23 cs.LG cs.AI cs.CL cs.CR 87%

Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM

Xiaoyu Wu, Yifei Pang, Terrance Liu, Zhiwei Steven Wu

机构 * Rice University(里士大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12095 2025-10-15 cs.CV 87%

IL3D: A Large-Scale Indoor Layout Dataset for LLM-Driven 3D Scene Generation

Wenxu Zhou, Kaixuan Nie, Hang Du, Dong Yin, Wei Huang, Siqiang Guo, Xiaobo Zhang, Pengbo Hu

机构 * University of Science and Technology of China(中国科学技术大学) Songying Technology(宋英科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 9 pages main paper; 15 pages references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00975 2025-10-14 cs.AI cs.CL cs.LG 87%

Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning

Zifeng Ding, Shenyang Huang, Zeyu Cao, Emma Kondrup, Zachary Yang, Xingyue Huang, Yuan Sui, Zhangdie Yuan, Yuqicheng Zhu, Xianglong Hu, Yuan He, Farimah Poursafaei, Michael Bronstein, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) AITHYRA

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏