arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2512.20168 2025-12-24 cs.CR cs.AI cs.LG 86%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19025 2025-12-24 cs.CR cs.AI cs.LG 86%

The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation

擦除幻觉:对LLM遗忘评估泛化能力的压测试

Hengrui Jia, Taoran Li, Jonas Guan, Varun Chandrasekaran

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSG框架,通过生成语义衍生但嵌入空间不同的替代数据集,揭示LLM无学习评估中普遍存在的度量不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19349 2025-12-23 cs.AI cs.LG 86%

VIGOR+: Iterative Confounder Generation and Validation via LLM-CEVAE Feedback Loop

VIGOR+: 通过LLM-CEVAE反馈循环实现迭代混杂因素生成与验证

JiaWei Zhu, ZiHeng Liu

机构 * Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VIGOR+通过LLM与CEVAE的反馈循环实现迭代混杂因素生成与验证,提升因果推断的统计效用。

Comments 7 pages,1 figure,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09149 2025-12-19 cs.CL cs.AI 86%

MindShift: Analyzing Language Models' Reactions to Psychological Prompts

MindShift: 分析语言模型对心理提示的反应

Anton Vasiliuk, Irina Abdullaeva, Polina Druzhinina, Anton Razzhigaev, Andrey Kuznetsov

机构 * FusionBrain Lab(融合大脑实验室) Applied AI Institute(应用人工智能研究院) Innopolis University(因诺普里斯大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 MindShift通过评估语言模型对心理提示的反应,揭示了模型在心理适应性和人格模拟方面的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15617 2025-12-18 cs.CL cs.AI 86%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 86%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14562 2025-12-17 cs.CL cs.AI 86%

Polypersona: Persona-Grounded LLM for Synthetic Survey Responses

Polypersona:基于身份的LLM生成合成调查回应

Tejaswani Dash, Dinesh Karri, Anudeep Vurity, Gautam Datla, Tazeem Ahmad, Saima Rafi, Rohith Tangudu

机构 * George Mason University, Virginia, USA(乔治·马歇尔大学) New Jersey Institute of Technology (NJIT), New Jersey, USA(新泽西理工学院) University of Southern Queensland, Queensland, Australia(南方昆士兰大学) Edinburgh Napier University, Edinburgh, Scotland(爱丁堡纳皮尔大学)

专题命中 评测与基准 :LLM(title);language model(abstract);small language model(abstract);instruction tuning(abstract)

AI总结 PolyPersona通过基于身份的微调,使小型语言模型能生成可靠且一致的合成调查数据,实现多领域高效调查数据生成。

Comments Accepted in IEEE Bigdata 2025- LLMs4ALL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14277 2025-12-17 cs.IR cs.AI cs.CL 86%

SPARQL-LLM: Real-Time SPARQL Query Generation from Natural Language Questions

SPARQL-LLM: 从自然语言问题实时生成SPARQL查询

Panayiotis Smeros, Vincent Emonet, Ruijie Wang, Ana-Claudia Sima, Tarcisio Mendes de Farias

机构 * SIB Swiss Institute of Bioinformatics(瑞士生物信息学研究所) University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SPARQL-LLM通过轻量级元数据方法,实现了从自然语言到SPARQL查询的高效生成,提升了准确性和效率,适用于实时低成本应用。

Comments 17 pages, 8 figures, 1 table. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15101 2025-12-16 cs.LG cs.CL cs.IT math.IT 86%

Cost-aware LLM-based Online Dataset Annotation

面向成本的基于大语言模型的在线数据集标注

Eray Can Elumar, Cem Tekin, Osman Yagan

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学) Dept. of Electrical Engineering(电气工程系) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CaMVo框架,通过自适应选择LLM子集降低标注成本,实现高效准确的数据集标注。

Journal ref In The Thirty-ninth Annual Conference on Neural Information Processing Systems, 2025. URL https://openreview.net/forum?id=3AdTRYA2uJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00057 2025-12-16 cs.PL cs.AI cs.LG cs.SE 86%

Incoherence as Oracle-less Measure of Error in LLM-Based Code Generation

不一致性作为无 oracle 的错误度量方法在基于 LLM 的代码生成中的应用

Thomas Valentin, Ardi Madadi, Gaetano Sapia, Marcel Böhme

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无 oracle 的错误度量方法,用于评估基于LLM的代码生成的正确性,通过不一致性度量有效识别错误程序并替代传统 oracle 评估。

Comments Accepted at AAAI'26 (extended version). 8 pages + refs and appendix

Journal ref 40th Annual AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09829 2025-12-11 cs.AI cs.LG 86%

RIFT: A Scalable Methodology for LLM Accelerator Fault Assessment using Reinforcement Learning

RIFT:一种利用强化学习的LLM加速器故障评估可扩展方法

Khurram Khalil, Muhammad Mahad Khaliq, Khaza Anuarul Hoque

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RIFT通过强化学习引导智能故障定位,实现高效LLM加速器故障评估,提升故障覆盖率与成本效益

Comments Accepted in the IEEE DATE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09662 2025-12-11 cs.CL cs.AI 86%

Can LLMs Evaluate What They Cannot Annotate? Revisiting LLM Reliability in Hate Speech Detection

大语言模型能否评估它们无法标注的内容?重新审视大语言模型在仇恨言论检测中的可靠性

Paloma Piot, David Otero, Patricia Martín-Rodilla, Javier Parapar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过主观性-aware框架重新评估大语言模型在仇恨言论检测中的可靠性,发现LLM生成的标注能反映模型性能趋势,可作为主观NLP任务的可扩展代理评估者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02350 2025-12-10 cs.CL cs.AI 86%

LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL

LLMSQL: 为大语言模型时代升级WikiSQL

Dzmitry Pihulski, Karol Charchut, Viktoria Novogrodskaia, Jan Kocoń

机构 * Department of Artificial Intelligence(人工智能系) Trusted Artificial Intelligence(可信人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLMSQL为大语言模型时代升级WikiSQL,提供干净的自然语言问题和完整SQL查询,提升文本到SQL模型的生成与评估效率。

Comments To appear in the Proceedings of the IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04346 2025-12-09 cs.CL cs.AI 86%

Multi-Lingual Cyber Threat Detection in Tweets/X Using ML, DL, and LLM: A Comparative Analysis

多语言推特/X中的网络威胁检测:使用机器学习、深度学习和大语言模型的比较分析

Saydul Akbar Murad, Ashim Dahal, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院) University of Southern Mississippi(密西西比大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了ML、DL和LLM在多语言推文网络威胁检测中的效果,发现双LSTM架构在多语言场景中表现最佳。

Journal ref IEEE Trans. Comput. Soc. Syst., Early Access, pp. 1-15, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05700 2025-12-08 cs.CL cs.AI 86%

Faithfulness metric fusion: Improving the evaluation of LLM trustworthiness across domains

可信度度量融合:提升跨领域的LLM可信度评估

Ben Malin, Tatiana Kalganova, Nikolaos Boulgouris

机构 * CEDPS Brunel University London London, UK(CEDPS 布伦大学伦敦 英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过融合多种可信度度量,提升LLM在不同领域中的可信度评估能力,并通过同质化数据集验证其有效性。

Comments 9 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05334 2025-12-08 cs.IR cs.AI cs.CL 86%

The Effect of Document Summarization on LLM-Based Relevance Judgments

文档摘要对基于大语言模型的相关性判断的影响

Samaneh Mohtadi, Kevin Roitero, Stefano Mizzaro, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了文档摘要对基于大语言模型的相关性判断可靠性及IR评估的影响,发现摘要判断在稳定性上与完整文档判断相当,但引入了系统性的标签偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 86%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17467 2025-12-03 cs.LG cs.AI 86%

PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM

具有图RAG的PersonaAgent:面向个性化LLM的社区感知知识图谱

Siqi Liang, Yudi Zhang, Yue Guo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PersonaAgent结合图RAG技术,通过构建社区感知的知识图谱,提升个性化LLM在新闻分类、电影标签和产品评分任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01992 2025-12-02 cs.AI cs.CL 86%

LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess

LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力

Sai Kolasani, Maxim Saplin, Nicholas Crispino, Kyle Montgomery, Jared Quincy Davis, Matei Zaharia, Chi Wang, Chenguang Wang

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者) UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01786 2025-12-02 cs.AI cs.LG 86%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03194 2025-12-02 cs.CL cs.AI 86%

Quantifying Cognitive Bias Induction in LLM-Generated Content

量化大语言模型生成内容中的认知偏差诱导

Abeer Alessa, Param Somane, Akshaya Lakshminarasimhan, Julian Skirzynski, Julian McAuley, Jessica Echterhoff

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究量化了大语言模型生成内容中的认知偏差,发现其在摘要和事实核查任务中存在框架偏差、幻觉和优先偏差,并提出针对性干预方法以减少对人类决策的影响。

Comments 21 pages (including references and appendix), 3figures. accepted to AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21747 2025-12-01 physics.chem-ph cs.AI cs.LG 86%

QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Screening and Language Model Benchmarking

QuantumChem-200K:一个大规模开放有机分子数据集用于量子化学性质筛选和语言模型基准测试

Yinqi Zeng, Renjie Li

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 QuantumChem-200K通过提供大规模有机分子数据集和微调语言模型,实现了光引发剂筛选和光敏感材料发现的高效预测。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 86%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 86%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04231 2025-11-27 cs.LG cs.AI 86%

Empowering Time Series Forecasting with LLM-Agents

用LLM代理增强时间序列预测

Chin-Chia Michael Yeh, Vivian Lai, Uday Singh Saini, Xiran Fan, Yujie Fan, Junpeng Wang, Xin Dai, Yan Zheng

机构 * Visa Research(Visa研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DCATS通过提升数据质量而非模型架构,为时间序列预测的AutoML提供了新的方法,实现了平均6%的误差减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15289 2025-11-25 cs.CR cs.AI cs.CL 86%

SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage

SATA: 一种通过简单辅助任务链接实现LLM劫持的范式

Xiaoning Dong, Wenbo Hu, Wei Xu, Tianxing He

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SATA通过简单辅助任务链接实现LLM劫持,有效绕过安全措施并提升攻击成功率

Comments ACL Findings 2025. Welcome to employ SATA as a baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08426 2025-11-25 cs.CL cs.AI cs.DB 86%

Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL

下一代数据库接口:基于大语言模型的文本到SQL调研

Zijin Hong, Zheng Yuan, Qinggang Zhang, Hao Chen, Junnan Dong, Feiran Huang, Xiao Huang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) College of Cyber Security, Jinan University(暨南大学网络安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文调研了基于大语言模型的文本到SQL方法,分析了技术挑战、数据集、指标及最新进展,并讨论了未来研究方向。

Comments Accepted to IEEE TKDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11946 2025-11-18 cs.CL cs.LG 86%

Improving LLM's Attachment to External Knowledge In Dialogue Generation Tasks Through Entity Anonymization

Hadi Sheikhi, Chenyang Huang, Osmar R. Zaïane

机构 * Dept. of Computing Science, University of Alberta(计算科学系,阿尔伯塔大学) Alberta Machine Intelligence Institute(阿尔伯塔人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11831 2025-11-18 cs.AI cs.CV cs.LG 86%

TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models

Wenhao Zhou, Hao Zheng, Rong Zhao

机构 * Center for Brain-Inspired Computing Research (CBICR)(脑启发计算研究中心) Department of Precision Instruments(精密仪器系) IDG/McGovern Institute for Brain Research(IDG/麦戈文脑研究学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11591 2025-11-18 cs.AI cs.CL 86%

LLM-Generated Negative News Headlines Dataset: Creation and Benchmarking Against Real Journalism

Olusola Babalola, Bolanle Ojokoh, Olutayo Boyinbode

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 50 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏