arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 66 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 66 篇

2608.23552 2026-08-25 cs.AI cs.CL cs.SE 新提交 91%

Prime Agent: A Self-Improving RLM Harness

Prime Agent:一种自改进的RLM管控框架

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Konstantin Dunas, Johannes Hagemann, Sami Jaghouar

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Prime Intellect

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。

Comments 16 pages, 10 figures. Technical report. Code: this https URL (https://github.com/PrimeIntellect-ai/prime-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-25 cs.AI 版本更新 89%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Yiyun Su, Zujun Peng, Yu Tian, Yuting Liu, Changruo Zhao, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract_cn);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11596 2026-08-25 eess.SP cs.AI eess.SY 交叉投稿 88%

Small Language Model enabled Autonomous agent for Language-Conditioned Cognitive Radar

基于小型语言模型的语言条件认知雷达自主智能体

Minhaj Uddin Ahmad, Zakia Zaman, Shunqiao Sun, Mizanur Rahman

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文提出一种小型语言模型驱动的自主智能体框架,作为语言条件认知雷达的智能控制器,经实验验证可在多种雷达场景下完成算法选择,且雷达特定提示与基于物理的工具执行是可靠决策的必要条件。

Comments Accepted at MLSP 2026, ATL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21381 2026-08-25 cs.CY cs.CL 新提交 85%

PersonaMem-v3: Toward Omni-Platform Personal Intelligence for Holistic User Understanding, Recommendation, and Agentic Tasks

PersonaMem-v3:面向全平台个人智能以实现全面的用户理解、推荐及智能体任务

Bowen Jiang, Yuan Yuan, Zhuoqun Hao, Yuchen Liu, Maohao Shen, Sihao Chen, Gregory Wornell, Chris Callison-Burch, Lyle Ungar, Dan Roth, Qi Guo, Xiangjun Fan, Camillo J. Taylor, Hanchao Yu

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.CL

AI总结 该研究提出PersonaMem-v3基准,用于评估全平台个人智能,助力开发兼具跨场景用户理解、可控推荐及合理个性化能力的LLM驱动智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-25 cs.CR cs.AI 版本更新 85%

Your Agentic LLMs Secretly Encode Indirect Prompt-Injection Exposure in Hidden States

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09855 2026-08-25 cs.AI cs.CL 版本更新 84%

The Greatness of Science Cannot Be Planned: Agentic Auto-Research is Fuzz Testing

智能体自动研究即模糊测试

Yifeng He, Jicheng Wang, Yinzhe Zhao, Chengyang Shi, Jiachen Liu, Hao Chen

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出自主研究智能体的“生成-排序”范式存在反馈稀疏性问题,类比灰盒模糊测试,指出自动研究需具备密集进展信号与反馈导向搜索能力,强调反馈架构是自动研究的核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23501 2026-08-25 cs.SE 新提交 83%

An Interactive Agent for Requirement-Driven Candidate Sourcing

面向需求驱动型候选人挖掘的交互式智能体

Yuanpeng He, Fangjing Li, Xiangyu Ru, Kexin Sun, Kun Yang, Lijian Li, Chi-Man Pun, Qingsong Wen, Wenpin Jiao, Mingkai Guo, Yirong Feng, Daiheng Gao, Zhi Jin

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 该研究针对自然语言描述的人才挖掘任务,提出首个交互式需求驱动型候选人挖掘智能体,在21个系统和691项需求上,其广度和召回率均优于现有基线模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23341 2026-08-25 cs.SE 新提交 83%

DPIAgent: Divide, Protocol, Isolate for Agentic Reproduction Test Generation

DPIAgent:面向智能体复现测试用例生成的Divide、Protocol、Isolate方法

Hao Liu, Steven Liu, Xin Zhang, Jane Luo, Yu Kang, Jie Wu, Fangkai Yang, Yangyu Huang, Pengfei Gao, Scarlett Li, Yan Lu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 DPIAgent是基于Divide、Protocol、Isolate原则的结构化智能体框架,将复现测试用例生成拆分为单目标阶段,在SWT-Bench Verified上优于七个基线方法,GPT-5成功率达81.76%,添加测试选择后升至86.17%,通用性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21444 2026-08-25 cs.AI cs.ET cs.HC cs.RO 新提交 83%

Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities

面向安全关键多无人机系统的智能体人工智能:挑战与机遇

Timothy Merritt, Alejandro Jarabo-Peñas, Juan Bravo-Arrabal, Maria-Theresa Bahodi, Anders Lyhne Christensen

机构 * Aalborg University(奥尔堡大学) University of Southern Denmark(南丹麦大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。

Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, this https URL (https://agentcraft-iui.github.io/2026/) - this http URL (http://CEUR-WS.org) proceedings forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21375 2026-08-25 cs.AI 新提交 83%

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

SchemaRouter:面向高效异构智能体检索增强生成的字段感知工具路由

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SchemaRouter是轻量级字段感知工具路由层,通过模式图实现工具与字段的精准选择,在材料科学基准中,其效率、准确率、工具精确率等表现优于基线,还能提供来源与许可信息。

Comments 13 pages, 4 figures, 6 tables. Code, benchmark, and fixtures: this https URL (https://github.com/JDeun/SchemaRouter_research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22930 2026-08-25 cs.AI cs.SE 新提交 82%

Concepts for Securing Agentic AI Coding and the Terok Environment

智能体AI编码的安全概念与Terok环境

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE;agent(comments);multi-agent(comments)

AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。

Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21470 2026-08-25 cs.CR 新提交 82%

Structural Inference in Undocumented Mobile Databases: A Reproducible Benchmark for Evaluating Agentic Reasoning in Digital Forensics

无文档移动数据库中的结构推断:用于评估数字取证中智能体推理能力的可复现基准

Jeel Piyushkumar Khatiwala, Divyangkumar Patel, Weifeng Xu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本研究构建了可复现基准,评估智能体对无文档移动数据库的结构推断能力,发现其在规则模式下可靠,模式模糊时性能骤降,需额外验证以确保推断关系可作为可靠取证证据。

Comments 10 pages, 2 figures. Published in Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-25 cs.AI 新提交 81%

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21829 2026-08-25 cs.CL cs.AI cs.IR 新提交 81%

Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores

训练知识库:智能体策划文档存储的监督结构学习

Yu Pan, Hongfeng Yu

机构 * University of Nebraska–Lincoln(内布拉斯加大学林肯分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出监督式结构学习方法训练知识库,以智能体策划文档存储,提升动作效率与准确率,其泛化性与键覆盖相关,欠训练的存储可通过增加训练问题进一步优化。

Comments 10 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21601 2026-08-25 cs.AI cs.CL 新提交 81%

K-Bench: measuring model performance on real scientific agent requests

K-Bench:衡量模型在真实科学智能体请求上的性能

Aubrey Brueckner, Darshil Patel, Yuhuan He, Timothy Kassis

机构 * K-Dense, Inc.(K-Dense公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究构建K-Bench 01基准,评估9个前沿模型处理真实科学请求的性能,发现无模型达领域科学家接受阈值,科学准确性难度高于沟通能力,核心应关注交付、宣称与产物的联合分布。

Comments 48 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21916 2026-08-25 cs.CE 新提交 80%

GenomeHarness: Harnessing Al Agents for Reliable Adaptation of Genome Language Models

GenomeHarness:利用AI智能体实现基因组语言模型的可靠适配

Weicai Long, Yusen Hou, Houcheng Su, Junning Feng, Yanlin Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 GenomeHarness是一种智能体式工具,通过受控搜索微调方案适配基因组语言模型,在52个模型-任务设置中多数提升了测试MCC,使下游适配更可靠可审计。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22133 2026-08-25 math.DG 新提交 80%

A Metric with Positive Sectional Curvature on $S^2\times S^3$

S²×S³上具有正截面曲率的度量

Shengtao Guo, Ethan X. Fang, Junwei Lu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 Odin Automatic AI Research Agent构造S²×S²上第一陈类(1,1)的主S¹-丛,经Cheeger形变等步骤,得到S²×S³上的正截面曲率黎曼度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23417 2026-08-25 cs.AI 新提交 79%

SkillAlchemy: Open-World Agent Skill Creation

SkillAlchemy:开放世界智能体技能创建

Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 SkillAlchemy是一个以准入为中心的基于源的开放世界智能体技能创建框架,在87个SkillsBench v1.1任务上,其技能通过率较无技能执行提升19.9个百分点、较最强自动化基线提升8.6个百分点,性能接近人工策划技能。

Comments 33 pages, 7 figures, 8 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23067 2026-08-25 cs.CL 新提交 79%

Signal or Noise? A Benchmark Study of Agent Skills in Web Development

信号还是噪声?智能体在Web开发中的技能基准研究

Ziyue Yang, Fan Ding

机构 * Baidu(百度)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究构建WebDev-Skills-Bench基准,通过实证分析Web开发智能体技能的效果,发现技能注入会降低任务性能、增加成本,提出需将技能视为特定三元组假设并建立对应评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22808 2026-08-25 cs.LG cs.MA cs.PF 新提交 79%

CatchBench: When Can an Agent Failure Be Caught?

CatchBench:智能体故障何时能被检测?

Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。

Comments 39 pages, 6 figures, 21 tables. Work in progress. Code and data: this https URL (https://github.com/yzhao062/catchbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22510 2026-08-25 cs.AI 新提交 79%

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

ClawProBench:基于运行时覆盖与冻结工作空间保留集的轨迹感知AI智能体评估

YuanHang Xiao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 该研究提出ClawProBench基准,基于OpenClaw运行时构建,通过含102场景的全配置集与68场景的冻结保留集评估AI智能体,采用安全门控公式评分,发现最终答案排行榜存在缺陷,不同评估视角的智能体排名差异显著。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-25 cs.CL 新提交 79%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21836 2026-08-25 cs.AI 新提交 79%

LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization

LLM4LLM:通过闭环智能体优化弥合内核基准与实际部署之间的差距

Hui Zeng, Pengfei Yang, Yanxin Chen, Fusong Ju, Xinran Wei

机构 * National Key Laboratory of Advanced Communication Networks(先进通信网络国家重点实验室) Xidian University(西安电子科技大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究人员提出LLM4LLM部署感知闭环优化框架,解决内核基准与实际部署的性能差距,在A100、H100的10个语言模型推理工作负载及KernelBench Level 2上实现显著加速。

Comments accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 79%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交 79%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22818 2026-08-25 math.OC 新提交 78%

Backward SDE characterization of the finite horizon Principal-Agent problem

有限周期委托代理问题的倒向随机微分方程刻画

Nizar Touzi, Yuxing Huang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过倒向随机微分方程刻画有限周期委托代理问题的委托人值函数,绕开完全非线性HJB方程,可处理代理人面临机制切换控制的新型委托代理问题。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22400 2026-08-25 cond-mat.mtrl-sci cs.MA 新提交 78%

Diagnosing and narrowing the simulation-to-real gap in powder X-ray diffraction with a wet-dry agentic loop

利用干湿智能体循环诊断并缩小粉末X射线衍射中的模拟到真实差距

Shaoguang Wang, Weiyu Guo, Ben Fei, Xiaohong Shao, Zhihui Wang, Wanli Ouyang

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 该研究针对粉末X射线衍射的模拟到真实差距,提出整合实测图谱微调等技术的Xtalyst智能体系统,通过干湿循环优化,提升了物相分析的准确性与覆盖度。

Comments 72 pages, 15 figures, 7 supplementary tables; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08401 2026-08-25 econ.GN cs.CR q-fin.ST stat.CO 版本更新 78%

Is Decentralized Finance Actually Decentralized? An Interdisciplinary Framework Integrating Network Theory, Agent-Based Simulation, and Longitudinal Evidence from Aave, GHO Issuance, and Cross-Chain Expansion

去中心化金融真的是去中心化的吗?整合网络理论、基于智能体的模拟以及来自Aave、GHO发行和跨链扩张的纵向证据的跨学科框架

Ziqiao Ao, Lin William Cong, Gergely Horvath, Luyao Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究构建跨学科框架,结合网络理论、智能体模拟与Aave等的纵向数据,发现DeFi的去中心化四维维度会背离,且GHO发行与跨链扩张对DeFi的参与度、集中度影响存在差异,可为相关评估提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20996 2026-08-25 cs.LG cond-mat.mtrl-sci 版本更新 77%

MADE: Benchmark Environments for Closed-Loop Materials Discovery

MADE:用于闭环材料发现的基准环境

Shreshth A Malik, Tiarnan Doherty, Panagiotis Tigas, Muhammed Razzak, Stephen J. Roberts, Aron Walsh, Yarin Gal

机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) Diffractive Labs Machine Learning Research Group, Department of Engineering Science, University of Oxford(机器学习研究组,工程科学系,牛津大学) Thomas Young Centre(托马斯·杨中心) Department of Materials, Imperial College London(材料系,伦敦帝国学院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG

AI总结 MADE提出了一种闭环材料发现的基准框架,通过模拟受限预算下的材料发现流程,评估发现算法的有效性和效率,并支持灵活的工作流研究。

Comments Poster at ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22432 2026-08-25 cs.CL cs.AI 新提交 73%

Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator

多语言大语言模型评判器中的排名反转:一种无标签双中心化校准器

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 针对多语言LLM评判器因提示语言导致排名反转的问题,提出无标签共识校准法(CBC),可提升排名一致性及与人工偏好的契合度,验证了其下游实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏