arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.07619 2026-07-09 cs.SE 新提交 86%

Rethinking Code Performance Benchmarks for LLMs

重新思考大语言模型的代码性能基准测试

Nhat Minh Le, Yisen Xu, Zhijie Wang, Tse-Hsun, Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究重新审视大语言模型代码性能基准测试,发现现有测试存在局限。提出基于LLM的多智能体框架生成性能导向测试,能更好暴露运行时差异,在原始测试无显著差异的任务中,该框架生成的测试有显著改进,优于当前最优技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05916 2026-07-08 cs.CR 新提交 86%

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

超越语法:安全专家是否信任大语言模型进行网络入侵检测系统规则工程?

Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络威胁下NIDS规则工程瓶颈,通过用户研究评估基于LLM的规则生成框架,揭示语法 - 语义悖论,从业者对其自主能力存疑,且大规模模型生成规则有效,小模型大多无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01953 2026-07-03 cs.SE 新提交 86%

Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models

欠指定并不意味着不一致:编码模型中语义坍缩的风险

Cedric Richter, Mike Papadakis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究发现LLM在任务描述欠指定时,常坍缩到单一错误解释,生成一致但行为错位的代码,称为有害语义坍缩,影响多个基准测试。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00596 2026-07-02 cs.CV 新提交 86%

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs

基于语义引导的LLM历史亚美尼亚报纸阅读顺序重建

Chahan Vidal-Gorène, Nadi Tomeh, Victoria Khurshudyan

机构 * École nationale des chartes-PSL(法国国立文献学院-巴黎文理研究大学) Inalco(法国国立东方语言文化学院) Calfa

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对历史亚美尼亚报纸复杂版面和低资源问题,提出混合方法结合语义区域检测与生成式LLM,排序错误率较几何基线降低76%。

Comments International Conference on Pattern Recognition, 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 86%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 86%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23667 2026-06-23 cs.DB 新提交 86%

The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data

表格另有说法:用反事实关系数据测试大语言模型

Xinzhi Wang, Chunwei Liu

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交 86%

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22247 2026-06-23 cs.SE 新提交 86%

Natural Language-Focused Software Engineering via Code-Documentation Equivalence

面向自然语言的软件工程:基于代码-文档等价性

Aryaz Eghbali, Zhongxin Liu, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出文档-代码等价性概念,通过自动生成等价文档的方法(Documentary)提升代码理解与编辑任务中LLM的准确性,实验显示准确率提升12.8-24.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20401 2026-06-19 eess.SY cs.SY 新提交 86%

PowerAgentBench-Dyn: A Benchmark for Agentic AI in Power System Dynamic Studies

PowerAgentBench-Dyn:电力系统动态研究中智能体AI的基准测试

Qian Zhang, Andrea Pomarico, Costas Mylonas, Magda Foti, Alberto Berizzi, Le Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-Dyn基准,用于评估基于LLM的智能体在电力系统动态分析任务中的能力,涵盖模型质量审查和安全风险筛选两个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 86%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 86%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract)

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18789 2026-06-18 eess.SY cs.SY 新提交 86%

PowerAgentBench-SS: A Benchmark for Agentic AI in Power System Steady-State Studies

PowerAgentBench-SS:电力系统稳态研究中智能体AI的基准测试

Costas Mylonas, Magda Foti, Andrea Pomarico, Matheus Duarte, Qian Zhang, Emmanouel Varvarigos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-SS基准框架,用于评估LLM智能体在电力系统稳态研究中执行工程工作流的能力,通过工具API、验证预算和风险敏感指标区分智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18285 2026-06-18 cs.SI cs.CY 新提交 86%

RELIANCE: Curating and Evaluating Reproductive Health Information on Social Media

RELIANCE: 策展与评估社交媒体上的生殖健康信息

Vaibhav Balloli, Laura Peyton Ellis, Vishala Mishra, Alice Chi, Alex Peahl, Elizabeth Bondi-Kelly

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对TikTok上孕期和产后健康信息,构建专家标注数据集RELIANCE,评估LLM事实核查能力,发现近60%信息准确,但整体与具体声明评估存在15%差距。

Comments Accepted at Datasets and Benchmarks Track, ACM Knowledge Discovery and Data Mining (KDD) 2026. Project page: https://realize-lab.github.io/RELIANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15809 2026-06-16 cs.CR 新提交 86%

AttackonCTF: Defending Hardware Security Competition Benchmarks in the Age of LLMs

AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准

Mohamadreza Rostami, Nikhilesh Singh, Stephen Muttathil, Lichao Wu, Chen Chen, Huimin Li, Jeyavijayan Rajendran, Ahmad-Reza Sadeghi

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13684 2026-06-15 cs.CY cs.AI cs.CL cs.LG 新提交 86%

Cross-Dataset Bloom Question Classification: Supervised Models and Prompted LLMs

跨数据集布鲁姆问题分类:监督模型与提示式大语言模型

Abdolali Faraji, Mohammadreza Molavi, Zohreh Rasoulkhani, Mohammadreza Tavakoli, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) University of Genoa(热那亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 评估监督ML/DL模型和LLM在跨数据集布鲁姆分类中的泛化能力,发现LLM更稳定,并基于最佳提示策略开发了轻量级UI。

Comments Accepted at AIED 2026. Abdolali Faraji and Mohammadreza Molavi contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12407 2026-06-11 cs.CV 新提交 86%

How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology

看似无关紧要的设计选择如何决定病理学中LLM的性能

Kian R. Weihrauch, Thomas A. Buckley, William Lotter, Arjun K. Manrai

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) Dana-Farber Cancer Institute(丹娜-法伯癌症研究所)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统因子分析发现,调整补丁大小、放大倍数等输入配置可使通用大语言模型在病理切片任务上性能大幅提升,缩小与专用模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10880 2026-06-10 cs.SE 新提交 86%

Writing Better Software Explanations: A Guideline-Based Approach

编写更好的软件解释:一种基于指南的方法

Martin Obaidi, Jean-Carl Kremser, Hannah Deters, Jakob Droste, Marc Herrmann, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种结合LLM生成与质量指南的软件解释编写工具,通过生成、检查、迭代修订流程提升效率和质量,实验表明工具支持的解释满意度显著高于纯人工编写。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17445 2026-08-19 cs.CR cs.CL 新提交 85%

Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services

跨不可链接身份的分解攻击:大语言模型服务的有状态防御的局限性

Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究发现,针对跨不可链接身份的分解攻击,现有有状态防御策略在攻击者可重试学习时无法有效阻止攻击,需引入身份链接等额外分组相关机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16416 2026-08-18 cs.LG cs.NE 新提交 85%

Evolving Executable Pipeline Programs for AutoML with Language Models

用语言模型演化用于自动机器学习的可执行流水线程序

Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 LACE是首个以代码形式构建通用表格型AutoML的框架,用语言模型演化可执行流水线,在68个OpenML分类任务上表现优异,其核心贡献是提供可直接复用的代码级搜索空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14797 2026-08-18 cs.CL 新提交 85%

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

超越令牌:大型语言与视觉-语言模型的解码方法综述

Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。

Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13326 2026-08-14 cs.CL 新提交 85%

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计

Junhao Luo, Ning Huang, Ziqi Sha, Wenxuan Tang, Wei Deng

机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。

Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 85%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07490 2026-08-11 cs.HC cs.AI 新提交 85%

Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents

经验敏感型游戏学习:人类与语言智能体的行为研究

Yingying Guo, Zhuoxuan Ju, Ruibo Ming, Ruicheng Feng, Jinjin Gu

专题命中 评测与基准 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建经验敏感型游戏学习框架,通过交互式游戏及相关指标分析人类与自进化语言智能体的游戏决策行为,发现人类会稳定转向全局策略,而自进化智能体的行为转变仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05960 2026-08-07 cs.CV cs.AI 新提交 85%

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) UKE Hamburg(汉堡大学医院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04899 2026-08-06 cs.CL 新提交 85%

Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

基于大语言模型的分类置信度估计中的评估缺陷与稀疏性限制

Elena Merdjanovska, Omar Zaidan, Andreas Rücklé

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究指出 LLM 分类置信度估计中 verbalization 方法存在稀疏性缺陷,AUARC 评估的插值选择会影响排名,提出 verbalization logprobs 方法可解决稀疏性并提升 AUARC 且无额外推理成本。

Comments Published at Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 33424-33435

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 85%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 85%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02444 2026-08-04 cs.AI 新提交 85%

ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

ParEvalLayer:当部分大语言模型智能体评估支持决策时

Wei-Jung Huang, Bonan Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出ParEvalLayer决策层,可基于部分任务结果判断LLM智能体比较结论,部分基准仅需15%-25%任务结果即可得出与完整评估一致的决策。

Comments Accepted at the 2026 ACM International Conference on AI-ML Systems (AIMLSystems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02171 2026-08-04 cs.AI 新提交 85%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏