arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2601.17348 2026-01-27 cs.AI 85%

Auditing Disability Representation in Vision-Language Models

对视觉-语言模型中残障人表示的审计

Srikant Panda, Sourabh Singh Yadav, Palkesh Malviya

机构 * Lam Research

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在残障人表示上的表现,通过引入残障情境化提示和评估框架,发现残障情境会降低模型解释忠实度,并提出针对性提示和微调方法来改善模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17010 2026-01-27 cs.LG stat.AP 85%

Optimizing the Landscape of LLM Embeddings with Dynamic Exploratory Graph Analysis for Generative Psychometrics: A Monte Carlo Study

通过动态探索图分析优化LLM嵌入景观:生成心理测量学的蒙特卡洛研究

Hudson Golino

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过动态探索图分析优化LLM嵌入景观,发现嵌入深度与项目池大小相关,需基于加权复合标准进行优化以平衡准确性和组织性。

Comments 18 pages, 6 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16964 2026-01-26 cs.AI 85%

AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems

AgentDrive: 一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentDrive是一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集,包含300,000个驾驶场景和100,000个问题的多项选择基准,用于评估和训练自主代理。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15556 2026-01-23 cs.CY cs.CL 85%

LLM or Human? Perceptions of Trust and Information Quality in Research Summaries

LLM还是人类?研究摘要中的信任与信息质量感知

Nil-Jana Akpinar, Sandeep Avula, CJ Lee, Brandon Dang, Kaza Razat, Vanessa Murdock

机构 * Microsoft(微软) Amazon AWS AI(亚马逊AWS人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了读者对LLM生成摘要的信任与质量感知,发现尽管难以识别LLM内容,但读者的信念显著影响评估,且LLM编辑的摘要更受好评。

Comments Accepted to ACM CHI conference on Human Factors in Computing Systems(CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15385 2026-01-23 cs.HC cs.CL 85%

VegaChat: A Robust Framework for LLM-Based Chart Generation and Assessment

VegaChat: 一种基于大语言模型的图表生成与评估稳健框架

Marko Hostnik, Rauf Kurbanov, Yaroslav Sokolov, Artem Trofimov

机构 * JetBrains

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VegaChat通过引入Spec Score和Vision Score两个指标,解决了LLM基于自然语言生成可视化中的评估难题,实现了高准确率的图表生成与评估。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17825 2026-01-22 cs.AI 85%

FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs

FAIRGAMER:评估基于LLM的视频游戏NPC中的社会偏见

Bingkang Shi, Jen-tse Huang, Long Luo, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu, Xiaodan Zhang, Zhongjiang Yao

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Johns Hopkins University(约翰霍普金斯大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FAIRGAMER通过评估三种交互模式中的社会偏见,揭示了基于LLM的视频游戏NPC在决策上的偏见问题,并指出更大模型可能加剧这些偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00971 2026-01-22 cs.SE cs.AI 85%

Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code

超越功能正确性:探索LLM生成代码中的幻觉

Fang Liu, Yang Liu, Lin Shi, Zhen Yang, Li Zhang, Xiaoli Lian, Zhongqi Li, Yuchi Ma

机构 * 2 State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE) School of Computer Science Engineering, Beihang University, Beijing, China 3 School of Software, Beihang University, Beijing, China 4 School of Computer Science Technology, Shandong University, Qingdao, China 5 Huawei Cloud Computing Technologies Co., Ltd, China

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了LLM生成代码中的幻觉问题,通过分类和分析建立全面的幻觉分类体系,并提出轻量级的幻觉缓解方法。

Comments Accepted by Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13658 2026-01-21 cs.CL 85%

Beyond Known Facts: Generating Unseen Temporal Knowledge to Address Data Contamination in LLM Evaluation

超越已知事实:生成未见的时间知识以应对LLM评估中的数据污染

Arthur Amalvy, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(中国科学院信息研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过生成未来未见的时间事实来构建无污染的评估数据集,以提升LLM在时间知识图谱提取任务中的评估准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13655 2026-01-21 cs.SE cs.AI cs.DC 85%

Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs

为何大语言模型停止计算:对开源大语言模型用户报告失败的实证研究

Guangba Yu, Zirui Wang, Yujie Huang, Renyi Zhong, Yuedong Zhong, Yilun Wang, Michael R. Lyu

机构 * The Chinese University of HongKong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过分析开源LLM的705个失败案例,揭示了部署堆栈的系统脆弱性,并提出提升LLM可靠性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13581 2026-01-21 cs.AI 85%

SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System

SCRIPTMIND:基于LLM的社会工程诈骗检测系统的犯罪脚本推断与认知评估

Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang

机构 * Korea University(韩国大学) Korean National Police Agency(韩国国家警察局) Inje University(仁荷大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ScriptMind通过结合自动化推理与人类认知,提升LLM在社会工程诈骗检测中的准确性与用户认知意识

Comments This paper has been accepted to the EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07902 2026-01-21 cs.CL 85%

Tailored Emotional LLM-Supporter: Enhancing Cultural Sensitivity

定制情感LLM支持者:增强文化敏感性

Chen Cecilia Liu, Hiba Arnaout, Nils Kovačić, Dana Atzil-Slonim, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technische Universität Darmstadt(通用知识处理实验室(UKP实验室)计算机科学系和海斯曼人工智能中心(hessian.AI)德意志联邦人家电大学) Department of Psychology, Bar-Ilan University(心理学系,巴伊兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CultureCare数据集,通过四种适应策略提升LLMs的文化敏感性,并展示其在临床培训中的应用潜力。

Comments Joint first authors; EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 85%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12951 2026-01-21 cs.SE cs.AI 85%

Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models

超越准确性:在(大)语言模型中表征代码理解能力

Felix Mächtle, Jan-Niclas Serr, Nils Loose, Thomas Eisenbarth

机构 * ITS, University of Luebeck(ITS,吕贝克大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在代码理解能力上的表现,发现其与传统人类度量标准相关性低,而影子模型能捕捉更复杂的模式,强调需改进基准方法以更准确评估模型能力。

Comments Published in the Proceedings of DeepTest 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 85%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16272 2026-01-21 cs.SE cs.AI 85%

Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls

超越盲区:用于缓解基于LLM评估缺陷的分析提示

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky

机构 * Ora Nova Fandina(奥拉诺瓦·法丁纳) Eitan Farchi(埃itan·法奇) Shmulik Froimovich(什mulik·弗罗伊米奇) Raviv Gal(拉维夫·加尔) Wesam Ibraheem(韦萨姆·伊布拉希姆) Rami Katan(拉米·卡坦) Alice Podolsky(艾丽斯·波德洛斯基)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种分析提示方法,通过结合LLM和分析检查器,提高代码评估的可靠性,减少LLM的盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11783 2026-01-21 cs.SE cs.CL 85%

The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing

稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性

Murtuza N. Shergadwala

机构 * Workday Inc.(Workday公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11643 2026-01-21 cs.CY cs.AI 85%

Syllabic Agglutinative Tokenizations for Indonesian LLM: A Study from Gasing Literacy Learning System

基于音节粘合的印尼语LLM分词方法:来自Gasing识字学习系统的研究

H. Situngkir, A. B. Lumbantobing, Y. Surya

机构 * Bandung Fe Institute(巴杜安费学院) Fe Institute & AI Research Center IT Del(费学院及IT德尔人工智能研究中心) AI Research Center IT Del(IT德尔人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于音节的印尼语分词方法,结合教学与计算优化,提升分词效率与语言模型性能。

Comments 12 pages, 1 figures

Journal ref BFI Working Paper Series 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05080 2026-01-21 cs.CL 85%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01412 2026-01-21 cs.CL 85%

Bias Association Discovery Framework for Open-Ended LLM Generations

面向开放型大语言模型生成的偏见关联发现框架

Jinhao Pan, Chahat Raj, Ziwei Zhu

机构 * Jinhao Pan Chahat Raj Ziwei Zhu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BADF框架,用于从开放型LLM生成中发现和分析人口身份与描述性概念的偏见关联。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01436 2026-01-21 cs.HC cs.AI 85%

Challenges & Opportunities with LLM-Assisted Visualization Retargeting

基于大语言模型的可视化重定向挑战与机遇

Luke S. Snyder, Chenglong Wang, Steven M. Drucker

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在可视化重定向中的应用挑战与机遇,通过对比两种方法评估LLM在代码生成和适应中的性能及局限性。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01386 2026-01-19 cs.LG 85%

ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs

ThinkEval: 基于思维的知识图谱对 LLM 编辑中知识泄漏的实用评估

Manit Baser, Dinil Mon Divakaran, Mohan Gurusamy

机构 * Electrical and Computer Engineering National University of Singapore(新加坡国立大学电子与计算机工程系) A*STAR Institute for Infocomm Research (A*STAR I 2 R), Singapore(新加坡A*STAR信息与通信研究机构)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ThinkEval通过构建专门知识图谱评估LLM编辑中的间接知识泄漏,揭示了现有编辑技术在平衡知识抑制与保留方面的不足。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10025 2026-01-16 cs.AI 85%

Structured Personality Control and Adaptation for LLM Agents

结构化人格控制与适应用于大语言模型代理

Jinpeng Wang, Xinyu Jia, Wei Wei Heng, Yuquan Li, Binbin Shi, Qianlei Chen, Guannan Chen, Junxia Zhang, Yuyu Yin

机构 * Key Laboratory of Complex Systems Modeling and Simulation of Ministry of Education(教育部复杂系统建模与仿真重点实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于荣格心理学类型模型的结构化人格控制框架,通过协调、强化补偿和反思机制实现LLM人格的细腻表达与动态适应,提升人机交互中的自然代理设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09250 2026-01-15 cs.CL 85%

When to Invoke: Refining LLM Fairness with Toxicity Assessment

何时触发:通过毒性评估提升LLM公平性

Jing Ren, Bowen Li, Ziqi Xu, Renqiang Luo, Shuo Yu, Xin Ye, Haytham Fayek, Xiaodong Li, Feng Xia

机构 * RMIT University(拉筹纳斯大学) Jilin University(吉林大学) Dalian University of Technology(大连理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FairToT通过推理时的提示引导毒性评估,提升LLM在不同群体间的公平性,减少群体差异并保持预测稳定性。

Comments Accepted by Findings of WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07504 2026-01-13 cs.LG cs.SE 85%

FROAV: A Framework for RAG Observation and Agent Verification -- Lowering the Barrier to LLM Agent Research

FROAV:一个用于RAG观察和代理验证的框架——降低LLM代理研究的门槛

Tzu-Hsuan Lin, Chih-Hsuan Kao

机构 * AetheTech

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FROAV提供了一个开源平台,通过可视化工作流编排、评估框架和Python集成,降低LLM代理研究的门槛,使研究人员能更专注于算法创新。

Comments 8 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07206 2026-01-13 cs.AI 85%

LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing

LLMRouterBench: 一个大规模基准和统一框架用于LLM路由

Hao Li, Yiqun Zhang, Zhaoyan Guo, Chenxu Wang, Shengji Tang, Qiaosheng Zhang, Yang Chen, Biqing Qi, Peng Ye, Lei Bai, Zhen Wang, Shuyue Hu

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLMRouterBench通过大规模基准和统一框架评估LLM路由方法,揭示了模型互补性、性能-成本权衡及路由方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06301 2026-01-13 cs.CR cs.AI cs.SE 85%

Beyond BeautifulSoup: Benchmarking LLM-Powered Web Scraping for Everyday Users

超越BeautifulSoup:为日常用户评估基于LLM的网络爬虫基准测试

Arth Bhardwaj, Nirav Diwan, Gang Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的网络爬虫在日常用户中的应用,展示了端到端LLM代理如何使复杂爬虫变得简单,同时比较了LLM辅助脚本和端到端代理在不同场景下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 85%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07063 2026-01-13 cs.AI 85%

Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach

迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法

Naseem Machlovi, Maryam Saleki, Innocent Ababio, Ruhul Amin

机构 * Fordham University(福特汉姆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05420 2026-01-12 cs.LG stat.AP stat.ME 85%

Efficient Inference for Noisy LLM-as-a-Judge Evaluation

高效噪声LLM-as-a-Judge评估

Yiqun T Chen, Sizhu Lu, Sijia Li, Moran Guo, Shengyi Li

机构 * Departments of Biostatistics and Computer Science, Johns Hopkins University(生物统计学与计算机科学系,约翰霍普金斯大学) Department of Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校) Department of Biostatistics, University of California, Los Angeles(生物统计学系,加州大学洛杉矶分校) Department of Biostatistics, Johns Hopkins University(生物统计学系,约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种高效方法,通过半参数效率理论统一了测量误差校正和预测驱动推断,以提高LLM-as-a-judge评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17749 2026-01-12 cs.AI 85%

Detection of LLM-Paraphrased Code and Identification of the Responsible LLM Using Coding Style Features

检测 LLM 生成的代码并识别负责的 LLM 使用编码风格特征

Shinwoo Park, Hyundong Jin, Jeong-won Cha, Yo-Sub Han

机构 * Yonsei University(延世大学) Changwon National University(昌原国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过编码风格特征检测 LLM 生成的代码并识别负责的 LLM,改进了检测性能和效率。

Comments In Engineering Applications of Artificial Intelligence, Vol. 162, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏