arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2605.29800 2026-05-29 cs.CL 90%

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

九位评委,两张有效选票:相关错误削弱了LLM评估小组

Guneet Kohli

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。

Comments 14 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29653 2026-05-29 cs.AI 90%

PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?

PTCG-Bench:LLM智能体能否掌握宝可梦集换式卡牌游戏?

Dongdong Hua, Yifei Sun, Renhong Huang, Feng Gao, Chunping Wang, Yang Yang

机构 * Zhejiang University(浙江大学) FinVolution Group(FinVolution集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PTCG-Bench基准,通过宝可梦集换式卡牌游戏评估LLM智能体的决策性能和自进化能力,并设计模块化消融实验分析智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29340 2026-05-29 cs.CL 90%

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

面向LLM安全评估的问答数据集研究:聚焦非法活动

Kenji Imamura, Masao Ideuchi, Atsushi Fujita

机构 * National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过人工分析AnswerCarefully数据集,提出额外信息、问答示例创建方法和评估准则,用于评估LLM在非法活动方面的安全性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29274 2026-05-29 cs.CL 90%

Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

基于LLM的自动评分中可学习的评估技能:通过迭代优化构建评分标准

Yun Wang, Xin Xia, Xuansheng Wu, Xiaoming Zhai, Ninghao Liu

机构 * School of Computing, University of Georgia, Athens, GA, USA(佐治亚大学计算机学院) AI4STEM Education Center, University of Georgia, Athens, GA, USA(佐治亚大学AI4STEM教育中心) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种迭代框架,使LLM能从评分经验中学习评估技能(即与题目无关的自然语言程序性知识),自动构建评分标准,无需人工干预,在ASAP-SAS数据集上超越专家编写的评分标准。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29225 2026-05-29 cs.AI 90%

BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents

BenchTrace: 用于测试LLM智能体反思能力和受控进化的基准

Jiahao Huang, Fei Cheng, Junfeng Jiang, Zefan Yu, Akiko Aizawa

机构 * University of Tokyo(东京大学) Kyoto University(京都大学) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BenchTrace基准,通过反思评估和进化评估两个任务,结合失败避免率(FAR)指标,系统评估LLM智能体的自我进化能力,实验发现当前模型在反思诊断和泛化上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29059 2026-05-29 cs.SE cs.AI cs.CR 90%

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

SCDBench: 基于大语言模型的智能合约反编译基准

Kaihua Qin, Dawn Song, Arthur Gervais

机构 * University of Warwick(沃里克大学) UC Berkeley(伯克利大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能合约反编译评估缺乏统一基准的问题,提出SCDBench数据集与评估方法,通过四阶段累积评估(格式完整性、可编译性、ABI恢复、语义一致性)测试前沿LLM的反编译能力,发现语义一致性仍远未解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29048 2026-05-29 cs.CL 90%

LLMBridge: An LLM Pipeline for End-to-end Referential Bridging Resolution in English

LLMBridge:用于英语端到端指代桥接消解的LLM流水线

Lauren Levine, Amir Zeldes

机构 * Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于LLM的端到端指代桥接消解系统LLMBridge,结合启发式预处理/后处理与LLM的自然语言推理能力,在三个英语数据集上超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29025 2026-05-29 cs.AI cs.CY cs.HC 90%

When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

当模型存在分歧:重新思考用于公众评论分析的LLM评估

Aisha Najera, Alvin Moon, Vedant Srinivasan, Rajesh Veeraraghavan

机构 * AI Lab, Princeton University Engineering and Applied Sciences(普林斯顿大学人工智能实验室、工程与应用科学学院) RAND Corporation(RAND公司) Engineering and Applied Sciences(工程与应用科学) Science, Technology, and International Affairs(科学、技术与国际事务) Georgetown University(乔治·华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种解释性审计流程,利用多模型分歧检测解释复杂性,引导人工审查关注真正模糊的公众意见,以补充传统基于准确率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23657 2026-05-29 cs.CL 90%

OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents

OpenSkillEval:自动审计LLM智能体的开放技能生态系统

Jiahao Ying, Boxian Ai, Wei Tang, Siyuan Liu, Yixin Cao

机构 * Singapore Management University(新加坡国立管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Joy Future Academy, JD(京东探索研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出自动评估框架OpenSkillEval,通过动态构建真实任务实例和收集社区技能,系统评估技能增强型智能体系统及技能本身,揭示技能可用性不保证有效使用、技能增强收益依赖模型和框架等关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08567 2026-05-29 cs.MA cs.CL 90%

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

ValueFlow: 多智能体大语言模型中价值扰动的传播度量

Jinnuo Liu, Chuke Liu, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ValueFlow框架,通过56维价值数据集和LLM-as-a-judge协议,将价值漂移分解为智能体级响应行为与系统级结构效应,揭示价值对齐是系统级属性。

Comments Preprint. Under review. 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28483 2026-05-28 cs.AI cs.IR 90%

From Learning Resources to Competencies: LLM-Based Tagging with Evidence and Graph Constraints

从学习资源到能力:基于证据和图约束的LLM标签方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * Université de technologie de Compiègne, CNRS, Heudiasyc(法国图卢兹技术大学、CNRS、Heudiasyc实验室) Sorbonne Université, CNRS UMR 7585, LPMHE(巴黎大学、CNRS UMR 7585、LPMHE实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种端到端对齐流程,利用大语言模型作为受约束的、能产生证据的标签器,将学习资源链接到结构化能力框架,在计算机科学数据集上取得优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28308 2026-05-28 cs.CL 90%

HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment

HELEA: 用于鲁棒实体对齐的硬负样本基准和基于LLM的重排序

Yoonjin Jang, Junwoo Kim, Youngjoong Ko

机构 * SungKyunKwan University(全州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对现有实体对齐基准中模型依赖名称重叠而非关系结构的问题,提出同名的硬负样本增强策略生成质量可控的评估基准和训练语料,并设计HELEA两阶段框架(实体编码器检索+LLM重排序),在硬负样本基准上实现鲁棒对齐。

Comments 10 pages, 3 figures, 9 tables. Code and benchmarks available at https://github.com/Wnsdnl/HELEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27766 2026-05-28 cs.AI 90%

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Aman Priyanshu, Supriti Vijay, Esha Pahwa

机构 * Foundation AI USA(Foundation AI美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过多智能体模拟平台评估LLM智能体在社交压力下的隐私泄露风险,发现多轮社交交互显著增加隐私泄露,且泄露具有社交传染性,即使有隐私指令也无法完全消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27566 2026-05-28 cs.AI 90%

DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents

DynaSchedBench: 基于LLM的调度代理中的校准动态调度基准与可观测性悖论

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北航计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环城院) Qingdao Research Institute, Beihang University(北航青岛研究院) Hangzhou Innovation Institute, Beihang University(北航杭州创新院) School of Artificial Intelligence, Xidian University, Xi'an 710071, Shaanxi, China(西电人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(西电广州技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对动态柔性作业车间调度问题(DFJSP),提出DynaSchedBench诊断框架,通过顺序事件空间校准器(SESC)计算调度压力指数(SSI)对实例进行难度分层,并揭示LLM调度代理中的“可观测性悖论”:完整结构信息反而降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27444 2026-05-28 cs.IR cs.AI 90%

A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations

检索增强生成与语言模型在太空操作中的系统评估

Ruben Belo, Marta Guimarães, Cláudia Soares

机构 * NOVA LINCS Neuraspace Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文系统评估了结合大语言模型与信息检索技术的检索增强生成管道在太空操作中提取和综合领域知识的效果,比较了不同检索策略、嵌入模型和LLM回答对信息准确性、相关性和可靠性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00180 2026-05-28 cs.NI cs.CL 90%

RouteProfile: Graph-Based Profiling for Cold-Start LLM Routing

RouteProfile:基于图的冷启动LLM路由画像方法

Jingjun Xu, Hongji Pu, Tao Feng, Haozhen Zhang, Jiaxuan You, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对冷启动LLM路由中新模型缺乏交互数据的问题,提出基于图结构的RouteProfile框架,利用技术报告中的公开信号构建模型画像,实验表明结构化画像优于扁平基线,且模型家族元数据比基准域信息更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00349 2026-05-28 cs.AI cs.MA 90%

COOP$^2$: Defining, Observing, and Repairing Cooperation in LLM Multi-Agent Systems

COOP$^2$: 定义、观察和修复LLM多智能体系统中的合作

Hanqing Yang, Narjes Nourzad, Shiyu Chen, Marie Siew, Jingdi Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出COOP$^2$框架,通过将高层合作动态与任务进度关联,定义可验证的合作任务,并开发COOP$^2$-Repair方法预测约束失败并引导修复,提升LLM多智能体系统的任务成功率和约束满足度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26911 2026-05-27 cs.AI 90%

TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews

TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强型代理

Hanqi Duan, Xiang Li

机构 * East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM生成的同行评审难以检测缺陷的问题,提出TADDLE工具增强型代理,通过四个专用分析工具和两阶段半监督学习,在二元检测和多标签分类任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20251 2026-05-27 cs.SE cs.AI 90%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08455 2026-05-27 cs.LG cs.PL cs.SE 90%

CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

CUDABeaver:基于LLM的自动化CUDA调试基准测试

Shiyang Li, Haoyang Chen, Mattia Fazzini, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出CUDABEAVER基准,通过协议条件指标pass@k(M,C,A)评估LLM修复CUDA代码的能力,揭示性能损失容忍度对成功率的影响。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11460 2026-05-27 cs.CL 90%

ADRD-Bench: A Preliminary LLM Benchmark for Alzheimer's Disease and Related Dementias

ADRD-Bench:阿尔茨海默病及相关痴呆症的初步大语言模型基准

Guangxin Zhao, Jiahao Zheng, Malaz Boustani, Jarek Nabrzyski, Yiyu Shi, Meng Jiang, Zhi Zheng

机构 * Electrical Engineering, University of Notre Dame(诺丁汉大学电气工程系) Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系) School of Medicine, Indiana University(印第安纳大学医学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准对阿尔茨海默病及相关痴呆症覆盖不足的问题,提出ADRD-Bench,包含统一问答和照护问答两部分,评估了36个LLM,发现顶级模型准确率高但推理质量不稳定。

Comments Update article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05899 2026-05-27 cs.AI 90%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05305 2026-05-27 cs.CL 90%

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

SONAR-LLM:在句子嵌入中思考、以令牌说话的自回归Transformer

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

机构 * FusionBrain Lab, AXXX(融合大脑实验室,AXXX) T-Tech MSU(莫斯科大学) DS-NLP Group, AXXX(自然语言处理组,AXXX)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SONAR-LLM,一种在连续SONAR嵌入空间“思考”但通过令牌级交叉熵监督的解码器-only Transformer,融合语义抽象与似然训练信号,在39M至1.3B参数规模上取得有竞争力的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14321 2026-05-27 cs.MA cs.CL 90%

Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems

超越自我对话:基于LLM的多智能体系统的通信中心综述

Bingyu Yan, Zhibo Zhou, Litian Zhang, Lian Zhang, Ziyi Zhou, Dezhuang Miao, Zhoujun Li, Chaozhuo Li, Xiaoming Zhang

机构 * School of Cyber Science and Technology, Beihang University, Beijing 100191, China(信息科学与技术学院,北京航空航天大学,北京100191,中国) The College of Cyber Security/College of Information Science and Technology, Jinan University, Guangzhou, China(网络安全学院/信息科学与技术学院,暨南大学,广州,中国) School of Computer Science and Engineering, Beihang University, Beijing 100083, China(计算机科学与工程学院,北京航空航天大学,北京100083,中国) School of Cyber Science and Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(信息科学与技术学院,北京邮电大学,北京100876,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从通信视角综述基于大语言模型的多智能体系统,提出一个整合系统级和系统内部通信的结构化框架,分析智能体交互机制、挑战及未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50857-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15787 2026-05-27 cs.CL cs.IR 90%

Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

交互式智能体:通过角色扮演的LLM-LLM交互模拟咨询师-来访者心理咨询

Huachuan Qiu, Zhenzhong Lan

机构 * School of Engineering, Westlake University(西lake大学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Interactive Agents框架,通过LLM-LLM角色扮演生成高质量心理咨询对话数据,解决隐私、成本和扩展性问题,并验证其治疗有效性和模型性能。

Comments Accepted to *SEM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26070 2026-05-26 cs.CL 90%

WhoSaidIt: Human-LLM Collaborative Annotation for Text-Based Multilingual Speaker-Attribute Classification

WhoSaidIt:面向文本的多语言说话人属性分类的人机协作标注

Lingyu Gao, Will Monroe, David Smith, Meghan Jemison, Jackie Lee

机构 * Duolingo

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种人机协作重标注框架,通过迭代交互和分歧采样稳定多语言说话人属性标签,构建WhoSaidIt数据集并评估LLM性能。

Comments 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25415 2026-05-26 cs.CL cs.CY cs.ET 90%

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

LLM-as-a-Reviewer: 基准测试它们作为论文审稿人的能力、分歧和提示注入抵抗性

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu

机构 * University of South Florida(佛罗里达南大学) Missouri University of Science and Technology(密苏里科技大学) University of Alabama(阿拉巴马大学) Florida International University(佛罗里达国际大学) University of Cincinnati(辛辛那提大学) George Mason University(乔治·梅森大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过一个系统基准测试,评估了12个大型语言模型在论文评审中的表现,包括评分校准、与人类审稿人的分歧以及对不可见字体映射攻击的抵抗性,发现LLMs存在系统性高估弱论文、与人类关注点不同以及易受提示注入攻击等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25232 2026-05-26 cs.SE cs.AI cs.LO 90%

Specification-Based Code-Text-Code Reengineering for LLM-Mediated Software Evolution

基于规约的代码-文本-代码重构:面向LLM介导的软件演化

Oleg Grynets, Vasyl Lyashkevych, Arsen Dolichnyi, Roman Piznak, Taras Zelenyy, Volodymyr Morozov

机构 * EPAM Systems(EPAM系统) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩) Lviv, Ukraine(乌克兰利沃夫) Kyiv, Ukraine(乌克兰基辅)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于规约的Code2Text2Code重构框架,通过将源代码转换为中性文本规约并迭代验证,解决直接Code2Code转换中的语义漂移、行为变化等问题,实现受控的LLM介导软件演化。

Comments 15 pages, 9 figures, 7 tables, 39 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24904 2026-05-26 cs.CL 90%

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

量化翻译错误对多语言大语言模型评估的影响

Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

机构 * TUD Dresden University of Technology and ScaDS.AI(德累斯顿技术大学和ScaDS.AI) InfAI e.V.(InfAI协会) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究机器翻译基准中的翻译错误如何影响多语言LLM评估的可靠性,通过自动错误跨度检测和准确性下降分析揭示翻译错误与评估指标之间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05847 2026-05-26 cs.CL 90%

Schema-Grounded LLM Extraction for FHIR Patient Digital Twins

基于Schema的LLM抽取用于FHIR患者数字孪生

Rafael Brens, Yuqiao Meng, Luoxi Tang, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SG-LLM方法,通过检索增强、JSON Schema约束和验证器修复循环,从非结构化EHR中生成有效的FHIR Bundle,并在临床效用实验中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏