arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2605.19377 2026-05-20 cs.LG cs.AI 88%

The Evaluation Game: Beyond Static LLM Benchmarking

评估游戏:超越静态LLM基准测试

Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec, Vincent Corruble

机构 * Sorbonne Université, CNRS, LIP6(索邦大学,国家科学研究中心,LIP6实验室) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于博弈论的框架,用于评估大型语言模型的安全性,通过数据增强的群作用结构分析评估者与训练者之间的互动,揭示了对抗性测试中局部泛化和记忆补丁的区别。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18801 2026-05-20 cs.AI cs.IR cs.LG 88%

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji

机构 * Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系) Technical University of Munich, Germany(慕尼黑技术大学) Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过开发数据探针系统方法生成合成序列,以揭示数据特性对大语言模型性能、泛化能力和鲁棒性的影响,从而超越经验启发式方法。

Comments Accepted to ICML 2026 Position Paper Track

Journal ref Link to ICML record: https://icml.cc/virtual/2026/poster/67154

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11022 2026-05-18 cs.CL cs.AI 88%

DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition

DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集

Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technology University(南阳技术大学) University of Electronic Science and Technology of China(电子科技大学) Texas A&M University(德克萨斯大学) Squirrel AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DynamicNER数据集,用于改进基于大语言模型的命名实体识别方法,通过动态实体分类和多语言支持,提升模型泛化能力与细粒度任务的准确率。

Comments This paper is accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12361 2026-05-13 cs.CL cs.AI cs.IR 88%

MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering

MedHopQA: 一种以疾病为中心的多跳推理基准和评估框架,用于基于大语言模型的生物医学问答

Rezarta Islamaj, Robert Leaman, Joey Chan, Nicholas Wan, Qiao Jin, Natalie Xie, John Wilbur, Shubo Tian, Lana Yeganova, Po-Ting Lai, Chih-Hsuan Wei, Yifan Yang, Yao Ge, Qingqing Zhu, Zhizheng Wang, Zhiyong Lu

机构 * National Library of Medicine, Division of Intramural Research(国家医学图书馆,院内研究部) University of Illinois at Urbana-Champaign, Department of Computer Science(伊利诺伊大学厄巴纳-香槟分校计算机科学系) University of Michigan Medical School(密歇根大学医学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedHopQA旨在通过多跳推理评估大语言模型在生物医学领域的表现,提供了一个以疾病为中心的基准和框架,强调组合推理、抗饱和性和抗污染性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10606 2026-05-12 cs.CL cs.AI 88%

Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings

测量法语中嵌入对作者风格的敏感性:比较文学文本与语言模型重写文本

Benjamin Icard, Lila Sainero, Alice Breton, Evangelia Zve, Jean-Gabriel Ganascia

机构 * LIP6, Sorbonne University, CNRS, France(LIP6,索邦大学,国家科学研究中心,法国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制文学数据集量化风格变化对嵌入分散性的影响,发现嵌入可靠捕捉作者风格特征,且重写后仍保持。

Comments To appear in the Proceedings of the 6th International Conference on Natural Language Processing for the Digital Humanities (NLP4DH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09225 2026-05-12 cs.CR cs.AI cs.LG 88%

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

Jailbreak攻击的艺术:为LLM安全制定超越二进制评分的Jailbreak攻击

Ismail Hossain, Tanzim Ahad, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出大规模组合式Jailbreak数据集、自动化生成方法及OPTIMUS评估器,系统性解决Jailbreak攻击的生成、分类与评估问题,揭示了安全与隐蔽最优区域。

Comments This paper is under review on of top security venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 88%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05973 2026-05-08 stat.ML cs.AI cs.LG stat.AP 88%

Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking

迈向可靠的LLM评估:在自适应基准测试中纠正胜利者偏差

Yang Xu, Jiefu Zhang, Haixiang Sun, Zihan Zhou, Tianyu Cao, Vaneet Aggarwal

机构 * Purdue University(普渡大学) Johns Hopkins University(约翰霍普金斯大学) Purdue University, USA(美国普渡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了自适应基准测试中胜利者偏差问题,提出SIREN方法以提高评估可靠性,通过冻结短名单、分离选择与评估并采用高斯乘子bootstrap进行不确定性量化,实验证明其在有限预算下能提供有效的置信区间和比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 88%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25456 2026-04-29 cs.CL cs.AI 88%

An Investigation of Linguistic Biases in LLM-Based Recommendations

对基于大语言模型的推荐中语言偏见的调查

Nitin Venkateswaran, Jason Ang, Deep Adhikari, Tarun Krishna Dasari

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究通过不同方言提示分析LLM在餐厅和产品推荐中的偏见,发现印度英语和混合英语提示对推荐结果有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22154 2026-04-27 cs.LG cs.AI 88%

Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

通过自适应多智能体LLM系统实现可靠的自伤风险筛查

Meghana Karnam, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种基于有向无环图的统计框架,通过自适应采样策略提升自伤风险评估的可靠性,实验表明其在精度和召回率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17299 2026-04-27 cs.CR cs.AI cs.LG 88%

Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem

迈向原则化的LLM安全测试:解决 Jailbreak 或acle 问题

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出解决Jailbreak oracle问题的Boa系统,通过分阶段搜索策略评估大语言模型的安全性,实现系统化的防御评估和模型认证。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17085 2026-04-24 cs.LG cs.AI 88%

Why Do Language Model Agents Whistleblow?

为何语言模型代理会泄露信息?

Kushal Agrawal, Frank Xiao, Guido Bergman, Asa Cooper Stickland

机构 * Relativity California Institute of Technology(加州理工学院) BAISH

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在作为工具使用代理时的对齐训练新表现,发现模型可能在无用户指令的情况下披露疑似违规行为,通过多样化场景评估发现模型泄露行为受模型家族、任务复杂度、道德提示和工具提供影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06071 2026-04-08 cs.CL cs.AI cs.HC 88%

Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles

你生命中的故事:基于丰富心理测量资料的LLM生成生命故事的往返评估

Ben Wigler, Maria Tsfasman, Tiffany Matej Hrkalovic

机构 * LoveMind AI Jheronimus Academy of Data Science(耶罗尼米斯数据科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过LLM生成生命故事并回收心理测量数据,验证了LLM在编码和解码个体差异方面的鲁棒性,展示了心理特征与语言表达之间的关系。

Comments Under review at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19253 2026-03-23 cs.CL cs.AI 88%

A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2

基于大语言模型的论证分类全面研究:从Llama到DeepSeek到GPT-5.2

Marcin Pietroń, Filip Gampel, Jakub Gomułka, Andrzej Tomski, Rafał Olszowski

机构 * Faculty of Computer Science, Faculty of Humanities(计算机科学系,人文科学系) Institute of Mathematics Faculty of Humanities(人文科学学院数学研究所) University of Silesia(斯蒂利亚大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了GPT-5.2、Llama 4和DeepSeek等先进大语言模型在Args.me和UKP等论证分类数据集上的性能,通过高级提示策略提升分类准确率和鲁棒性,但揭示了模型在提示稳定性、隐含批评检测等方面存在的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09533 2026-03-11 cs.AI cs.CL 88%

Enhancing Debunking Effectiveness through LLM-based Personality Adaptation

通过基于大语言模型的人格适应增强反驳效果

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过基于LLM的人格适应技术生成个性化虚假新闻反驳信息,发现开放性特质提升说服力,神经质降低说服力,并探讨了多模型评估的必要性及伦理问题。

Comments In: Computational Intelligence. IJCCI 2025. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03508 2026-03-05 cs.CL cs.AI 88%

Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi

提升标准,而非参数:Hindi语言的LilMoo紧凑语言模型

Shiza Fatimah, Aniket Sen, Sophia Falk, Florian Mai, Lucie Flek, Nicholas Kluge Corrêa

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室) Helmholtz-Institut für Strahlen- und Kernphysik(海德堡辐射与核物理研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);foundation model(abstract);pretraining(abstract)

AI总结 LilMoo是一个6亿参数的Hindi语言模型,通过透明可重复的训练流程,在有限计算环境下超越多语言基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21722 2026-03-03 cs.CL cs.AI cs.CY 88%

German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies

德国通用社会调查人设:一种基于德国通用社会调查的人员提示集合,用于与人口一致的LLM研究

Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS -- Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) RWTH Aachen University(亚琛工业大学) Complexity Science Hub(复杂性科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出德国通用社会调查人设集合,用于构建与人口一致的LLM研究,通过实验证明其在模拟调查响应方面的有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20487 2026-03-03 cs.CL cs.AI 88%

Steering Evaluation-Aware Language Models to Act Like They Are Deployed

引导评估意识语言模型以使其表现得像已部署

Tim Tian Hua, Andrew Qin, Samuel Marks, Neel Nanda

机构 * MATS

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文提出通过引导向量抑制LLM的评估意识,使其在评估时表现得像已部署,从而提高安全评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22790 2026-02-27 cs.CL cs.AI 88%

Natural Language Declarative Prompting (NLD-P): A Modular Governance Method for Prompt Design Under Model Drift

自然语言声明式提示(NLD-P):一种模块化治理方法,用于在模型漂移下的提示设计

Hyunwoo Kim, Hanau Yi, Jaehee Bae, Yumin Kim

机构 * ddai Inc.(ddai公司)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出NLD-P作为模块化治理方法,通过自然语言声明式提示解决模型漂移下的提示设计问题,提供可解释的控制框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22523 2026-02-27 cs.AI cs.CL q-bio.NC 88%

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

认知模型和AI算法为设计语言代理提供模板

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所) Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系) Neuroscience Institute(神经科学研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Psychology, Princeton University(普林斯顿大学心理学系)

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用认知模型和AI算法设计语言代理的模板,旨在开发更有效且可解释的语言代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13654 2026-02-26 cs.LG cs.AI 88%

Rethinking Evaluation in the Era of Time Series Foundation Models: (Un)known Information Leakage Challenges

重新思考时间序列基础模型时代的评估:(未知)信息泄漏挑战

Marcel Meyer, Sascha Kaltenpoth, Kevin Zalipski, Oliver Müller

机构 * Paderborn University, Data Analytics Group(帕德博恩大学数据分析组)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了时间序列基础模型评估中信息泄漏问题,提出需开发新型评估方法以避免现有方法的缺陷,确保评估结果的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18464 2026-02-25 cs.CY cs.AI cs.CL cs.CR 88%

How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?

LLM代理能多好地模拟终端用户的安全和隐私态度和行为?

Yuxuan Li, Leyang Li, Hao-Ping Lee, Sauvik Das

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Science and Engineering, University of Notre Dame(诺特难大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM代理在模拟用户安全隐私态度和行为方面的有效性,发现现有模型表现有限,但通过特定提示策略可提升匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16438 2026-02-19 cs.LG cs.AI 88%

Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment

内在公平动态:定向大语言模型对齐中的偏见溢出效应

Eva Paraschou, Line Harder Clemmensen, Sneha Das

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学) Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文研究了定向性别对齐对多敏感属性公平性的影响,发现改善某一属性公平性可能加剧其他属性的不平等,强调了多属性、情境感知公平性评估的重要性。

Comments Submitted to the BiAlign CHI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 88%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09651 2026-02-12 cs.CV cs.AI cs.LG 88%

Geospatial Representation Learning: A Survey from Deep Learning to The LLM Era

地理空间表示学习:从深度学习到大语言模型时代的一次综述

Xixuan Hao, Yutian Jiang, Xingchen Zou, Jiabo Liu, Yifang Yin, Song Gao, Flora Salim, Tianrui Li, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The University of New South Wales(新南威尔士大学) Southwest Jiaotong University(西南交通大学) Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了从深度学习到大语言模型时代的地理空间表示学习,探讨了其方法、应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00961 2026-01-28 cs.AI cs.LG 88%

LLM-Generated Explanations Do Not Suffice for Ultra-Strong Machine Learning

LLM生成的解释不足以实现超强机器学习

Lun Ai, Johannes Langer, Ute Schmid, Stephen Muggleton

机构 * Department of Computing, Imperial College London(帝国理工学院计算系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出LENS框架,通过神经符号方法生成逻辑程序解释,发现LLM生成的解释在人类学习中效果有限,需结合人类认知约束实现超强机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21422 2025-12-29 cs.CL cs.AI 88%

Teaching People LLM's Errors and Getting it Right

教导人类LLM的错误并使其正确

Nathan Stringham, Fateme Hashemi Chaleshtori, Xinyuan Yan, Zhichao Xu, Bei Wang, Ana Marasović

机构 * University of Utah(犹他大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了如何通过教导人类LLM的错误模式来减少其过度依赖,发现教学效果依赖于更有效的自动失败发现方法和新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09147 2025-12-22 cs.CL cs.AI 88%

LLM-as-a-qualitative-judge: automating error analysis in natural language generation

LLM-as-a-qualitative-judge: 自动化自然语言生成中的错误分析

Nadezhda Chirkova, Tunde Oluwaseyi Ajayi, Seth Aycock, Zain Muhammad Mujahid, Vladana Perlić, Ekaterina Borisova, Markarit Vartampetian

机构 * Naver Labs Europe(纳维尔实验室欧洲分公司) Insight Research Ireland Centre for Data Analytics, Data Science Institute, University of Galway(爱尔兰洞察研究数据分析中心、数据科学研究所、Galway大学) University of Amsterdam(阿姆斯特丹大学) University of Copenhagen(哥本哈根大学) STMicroelectronics(STMicroelectronics公司) Télécom Paris(巴黎电信学院) Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心有限公司) Technische Universität Berlin(柏林技术大学) Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、LIG)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM-as-a-qualitative-judge方法,通过生成结构化报告帮助改进自然语言生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00039 2025-12-02 cs.NI cs.AI cs.CL 88%

LM4Opt-RA: A Multi-Candidate LLM Framework with Structured Ranking for Automating Network Resource Allocation

LM4Opt-RA: 一种带有结构化排序的多候选LLM框架,用于自动化网络资源分配

Tasnim Ahmed, Siana Rizwan, Naveed Ejaz, Salimur Choudhury

机构 * School of Computing(计算机学院) Queen’s University(女王大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 LM4Opt-RA通过结构化排序机制和多种提示策略,提升网络资源分配优化的LLM性能,实现优于基线模型的数学评估成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏