arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2604.25359 2026-04-29 cs.CL cs.AI 88%

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

结构化输出基准:一个多源基准,用于评估大型语言模型中的结构化输出质量

Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani, Vineet Agarwal

机构 * JigsawStack, Inc.(JigsawStack公司) New Delhi, India(印度新德里) San Francisco, CA, USA(美国旧金山) Durgapur, WB, India(印度德里邦杜格apur)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SOB基准,用于评估大型语言模型在多源数据中的结构化输出质量,通过文本、图像和音频三种模态的测试数据,发现模型在结构合规性上表现良好,但价值准确性在不同数据源中差异显著。

Comments 19 pages, 4 figures, 11 tables, submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16378 2026-04-28 cs.CL cs.AI cs.SD 88%

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

听译:将语音模态整合到LLMs中的有效性

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánchez, Ahrii Kim, Dominik Macháček, Patricia Schmidtova, Maike Züfle

机构 * Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) Barcelona Supercomputing Center(巴塞罗那超级计算中心) University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Politècnica de València(瓦伦西亚理工大学) Soongsil University(顺天大学) Charles University(查尔斯大学) KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文评估了将语音模态整合到LLMs中的有效性,发现级联系统总体更可靠,但最新SpeechLLMs在某些情况下可匹配或超越级联系统,而SFM表现较差,强调整合LLM的重要性。

Comments Project available at https://github.com/sarapapi/hearing2translate | Accepted at TACL, this version is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 88%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19887 2026-04-23 cs.CL cs.AI 88%

Depression Risk Assessment in Social Media via Large Language Models

通过大语言模型在社交媒体上评估抑郁症风险

Giorgia Gulino, Manuel Petrucci

机构 * Guglielmo Marconi University, Department of Human Sciences(圭里莱莫·马尔科尼大学人文科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的系统,通过多标签分类八种抑郁相关情绪和计算加权严重性指数,评估Reddit帖子中的抑郁症风险,实验结果显示模型在零样本设置下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 88%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19781 2026-04-23 cs.CY cs.AI cs.CL 88%

Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment

小型语言模型知道它们犯错时吗?基于置信度的级联评分用于教育评估

Tyler Burleigh

机构 * PhD(博士)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过置信度评估确定级联系统中何时升级任务,发现置信度差异影响评分准确性与成本,最佳级联在降低成本和延迟的同时接近大模型性能。

Comments 12 pages, 7 figures. Accepted at NCME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18775 2026-04-22 cs.CL cs.LG 88%

An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

多代采样在大型语言模型 jailbreak 检测中的实证研究

Hanrui Luo, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过JailbreakBench数据集和多种生成模型,评估了基于输出的jailbreak检测方法,发现单输出评估低估了模型漏洞,多代采样能更准确检测有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17730 2026-04-21 cs.CL cs.AI cs.HC 88%

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

MHSafeEval:面向大语言模型中心理健康安全的交互层面角色感知评估

Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng

机构 * Department of Artificial Intelligence, Hanyang University(翰艺大学人工智能系) School of Computing and Information Systems, Singapore Management University(新加坡国立管理学院信息系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MHSafeEval框架,通过角色感知模型评估大语言模型在多轮对话中的心理健康安全问题,揭示角色依赖性和累积性安全故障,提升故障模式覆盖和诊断精度。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25897 2026-04-20 cs.CL cs.AI cs.CY 88%

RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity

RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准

Jisu Shin, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20635 2026-04-15 cs.CL cs.AI 88%

Why Did Apple Fall: Evaluating Curiosity in Large Language Models

苹果为何坠落:评估大语言模型中的好奇心

Haoyu Wang, Sihang Jiang, Yuyan Chen, Xiaojun Meng, Jiansheng Wei, Yitong Wang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文基于人类好奇心评估量表,设计评估框架,发现大语言模型对知识有更强的渴求,但在不确定环境中仍保守,好奇心可提升推理与学习能力。

Comments ACL 2026 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 88%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 88%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 88%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06213 2026-04-09 cs.CL cs.AI 88%

Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models

不可见的影响:通过大型语言模型中的角色工程探究隐性交叉偏见

Nandini Arimanda, Achyuth Mukund, Sakthi Balan Muthiah, Rajesh Sharma

机构 * Shiv Nadar University Chennai(钦奈希夫纳达尔大学) Plaksha University(普拉克沙大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色工程研究大型语言模型中的隐性交叉偏见,提出BADx指标,揭示角色上下文对偏见动态影响的机制,评估五种LLM在不同角色框架下的表现。

Comments 11 pages, 5 figures, ACM WebScience Conference, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 88%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00002 2026-04-02 cs.CL cs.AI 88%

Benchmark for Assessing Olfactory Perception of Large Language Models

嗅觉感知基准测试

Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis

机构 * Patina(Patina公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嗅觉感知基准测试,评估大语言模型对气味的推理能力,发现化合物名称提示优于SMILES表示,揭示LLM主要通过词汇关联而非结构分子推理获取嗅觉知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM 88%

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 88%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20514 2026-03-24 cs.CL cs.AI 88%

Evaluating Large Language Models on Historical Health Crisis Knowledge in Resource-Limited Settings: A Hybrid Multi-Metric Study

在资源有限环境中评估大型语言模型对历史健康危机知识的评估:一种混合多指标研究

Mohammed Rakibul Hasan

机构 * organization= Department of Electrical \& Computer Engineering , addressline= North South University , city= Dhaka , country= Bangladesh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估GPT-4、Gemini Pro、Llama 3和Mistral-7B在低资源环境下对新冠、登革热、尼帕病毒和登革热等健康危机问题的处理能力,通过语义相似度、专家评估和NLI方法分析模型表现,揭示LLM在流行病学历史和健康危机知识表示中的优缺点。

Comments Comments: 20 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18007 2026-03-20 cs.CL cs.AI 88%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16197 2026-03-18 cs.AI cs.CL 88%

Are Large Language Models Truly Smarter Than Humans?

大语言模型真的比人类更聪明吗?

Eshwar Reddy M, Sourav Karmakar

机构 * Applied AI Scientist, Health Vectors(应用人工智能科学家,健康向量) Senior AI Scientist, Intuit India(高级人工智能科学家,Intuit印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过三个实验评估六种前沿大语言模型的评估数据污染问题,发现STEM领域污染率最高,且部分模型存在记忆偏差。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06533 2026-03-18 cs.AI cs.CL 88%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14173 2026-03-17 cs.LG cs.AI cs.IR 88%

Hybrid Intent-Aware Personalization with Machine Learning and RAG-Enabled Large Language Models for Financial Services Marketing

混合意图感知个性化:结合机器学习和RAG增强的大语言模型用于金融服务营销

Akhil Chandra Shanivendra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合架构,结合传统机器学习与RAG增强的大语言模型,用于金融服务营销中的个性化营销,通过时间编码器、潜在表示和多任务分类提高个性化准确性。

Comments 18 pages, 5 figures, 3 tables. Applied ML systems paper. The contribution is architectural rather than algorithmic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11597 2026-03-13 cs.CL cs.AI 88%

Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese

开源大语言模型在协助日文病历报告写作中的性能评估

Masataka Kawai, Singo Sakashita, Shumpei Ishikawa, Shogo Watanabe, Anna Matsuoka, Mikio Sakurai, Yasuto Fujimoto, Yoshiyuki Takahara, Atsushi Ohara, Hirohiko Miyake, Genichiro Ishii

机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。

Comments 9 pages (including bibliography), 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 88%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09985 2026-03-12 cs.CL cs.AI 88%

The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration

大型语言模型中的邓宁-克鲁格效应:对置信度校准的实证研究

Sudipta Ghosh, Mrityunjoy Panday

机构 * Cognizant Technology Solutions(Cognizant技术解决方案)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型在置信度校准上存在类似邓宁-克鲁格效应的过度自信现象,通过实验证明低性能模型更易高估自身能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05503 2026-03-12 cs.LG cs.AI 88%

Over-Searching in Search-Augmented Large Language Models

搜索增强型大语言模型中的过度搜索

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了搜索增强型大语言模型中的过度搜索问题,提出TPC指标量化其性能与成本的权衡,并探讨了缓解方法。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04664 2026-03-11 cs.CL cs.AI 88%

CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models

CRANE: 多语言大语言模型中语言特异性神经元的因果相关性分析

Yifan Le, Yunliang Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CRANE通过神经元层面的干预分析,揭示多语言大模型中语言特异性神经元的因果相关性,更精确地分离语言特异性组件。

Comments 10 pages, 6 figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07792 2026-03-10 cs.CL cs.AI cs.CY 88%

Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Context

大语言模型中社会偏见的双指标评估:来自少数族裔尼泊尔文化背景的证据

Ashish Pandey, Tek Raj Chhetri

机构 * Center for Artificial Intelligence Research Nepal(尼泊尔人工智能研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过双指标评估框架,分析了大语言模型在尼泊尔文化背景下对性别、种族和社会文化刻板印象的偏见,揭示了显性一致性偏见与隐性生成偏见的关系及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL 88%

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏