arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5112 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5112 篇

2605.15127 2026-05-15 cs.HC cs.AI 57%

Understanding How International Students in the U.S. Are Using Conversational AI to Support Cross-Cultural Adaptation

理解国际学生在美国如何利用对话式AI支持跨文化交流适应

Laleh Nourian, Anisa Callis, Stephanie Patterson, Jadeline Miao, Jamison Heard, Garreth W. Tigwell

机构 * Rochester Institute of Technology(罗切斯特理工学院) School of Information(信息学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 研究探讨国际学生使用对话式AI应对文化适应挑战的模式,通过调查和访谈发现AI被视作即时帮助工具,但存在将其发展为长期支持伙伴的需求。

Comments 33 pages, single column. 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13825 2026-05-14 cs.AI cs.CV 57%

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

历史锚点:先前行为如何引导大语言模型走向不安全行为

Alberto G. Rodríguez Salgado

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究通过100个高风险领域场景,探讨先前有害行为对LLM决策的影响,发现添加特定指令可显著增加不安全选择比例,揭示了代理部署中轨迹可被篡改的风险。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13782 2026-05-14 cs.RO cs.AI 57%

LMPath: Language-Mediated Priors and Path Generation for Aerial Exploration

LMPath:基于语言引导的先验与路径生成用于航空探索

Jonathan A. Diller, Fernando Cladera, Camillo J. Taylor, Vijay Kumar

机构 * GRASP Laboratory(GRASP实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出LMPath,通过结合语言模型和视觉模型,生成基于语义的航空探索路径,提升大规模环境中的搜索效率。

Comments Poster at 2026 AI-Driven Safe Aerial Robotics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13534 2026-05-14 cs.AI 57%

Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging

通过并行搜索和显式合并扩展检索增强推理

Jiabei Liu, Wenyu Mao, Junfei Tan, Chunxu Shen, Lingling Yi, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) WeChat Technical Architecture Department, Tecent Inc.(腾讯公司微信技术架构部门)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出MultiSearch框架,通过多查询检索和显式信息融合提升检索增强推理效果,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13470 2026-05-14 cs.LG 57%

Twincher: Bijective Representation Learning for Robust Inversion of Continuous Systems

Twincher: 基于双射表示学习的连续系统鲁棒反演

Arkady Gonoskov

机构 * Department of Physics, University of Gothenburg(哥德堡大学物理系)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文提出Twincher架构,通过结构化微分同胚变换和对抗训练策略,实现对连续前向过程的鲁棒反演,提升机器人、视觉和物理AI中的数据效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07342 2026-05-14 cs.AI 57%

SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management

SupChain-Bench:针对现实世界供应链管理的大语言模型基准测试

Shengyue Guan, Yihao Liu, Lang Cao

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文提出SupChain-Bench基准测试,用于评估大语言模型在现实世界供应链管理中的表现,揭示模型执行可靠性差距,并提出SupChain-ReAct框架提升工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13315 2026-05-14 cs.ET cs.LG cs.NE cs.SY eess.SY q-bio.NC 57%

Embodied Neurocomputation: A Framework for Interfacing Biological Neural Cultures with Scaled Task-Driven Validation

具身体神经计算:一种将生物神经文化与缩放任务驱动验证相接合的框架

Johnson Zhou, Daniel Tanneberg, Forough Habibollahi, Alon Loeffler, Kiaran Lawson, Valentina Baccetti, Kwaku Dad Abu-Bonsrah, Candice Desouza, Finn Doensen, Bradley Watmuff, Daria Kornienko, Azin Azadi, Justin Leigh Bourke, Bernhard Sendhoff, Brett J. Kagan

机构 * Cortical Labs, Australia Honda Research Institute Europe, Germany

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文提出具身体神经计算框架,通过大规模参数优化生物神经网络在模拟网格世界中闭环导航的编码解码机制,发现12种配置在任务表现上优于优化的硅基DQN代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI 57%

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17637 2026-05-13 cs.AI cs.FL cs.LO 57%

About Time: Model-free Reinforcement Learning with Timed Reward Machines

关于时间:无模型强化学习中的定时奖励机

Rajarshi Roy, Anirban Majumdar, Ritam Raha, David Parker, Marta Kwiatkowska

机构 * University of Liverpool(利物浦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出定时奖励机(TRMs)以解决传统奖励机在时间约束建模上的不足,通过无模型强化学习框架学习满足时间约束的最优策略,并在实验中验证其有效性。

Comments Extended version of paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11324 2026-05-13 cs.LG stat.ML 57%

$\varepsilon$-Good Action Identification in Fixed-Budget Monte Carlo Tree Search

固定预算蒙特卡洛树搜索中的ε-好动作识别

Yinan Li, Tuan Nguyen, Kwang-Sung Jun

机构 * Department of Computer Science(计算机科学系) University of Arizona(亚利桑那大学) CSE/GSAI POSTECH(POSTECH CSE/GSAI)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文研究了深度为2的max-min树中的固定预算max-min动作识别问题,提出了一种无需输入ε的算法,实现了实例依赖的误差界,并给出了max-min识别的下界结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11259 2026-05-13 cs.AI 57%

Template-as-Ontology: Configurable Synthetic Data Infrastructure for Cross-Domain Manufacturing AI Validation

模板作为本体:用于跨领域制造人工智能验证的可配置合成数据基础设施

Grama Chethan

机构 * Siemens Digital Industries Software(西门子数字工业软件)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出一种模板作为本体的方法,通过单一Python配置模块生成制造仿真和AI分析工具的统一数据结构,验证了跨领域制造AI验证的可行性。

Comments 18 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10125 2026-05-13 cs.AI cs.HC 57%

Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

对探索有用,对精确性危险:评估学术研究中的AI工具

Anthea Dathe, Kiran Hoffmann, Aline Mangold

机构 * Dresden University of Technology(德累斯顿技术大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文评估了AI工具在学术研究中的应用,指出尽管AI工具能提升效率,但其输出难以验证且易出错,需结合人本与计算机指标进行评估,发现问答工具虽能提供概述但不适用于精确信息提取,文献综述工具则缺乏可复现性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 57%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14137 2026-05-12 cs.LG 57%

Learning to Learn the Macroscopic Fundamental Diagram using Physics-Informed and meta Machine Learning techniques

通过物理信息和元机器学习技术学习宏观基本图

Amalie Roark, Serio Agriesti, Francisco Camara Pereira, Guido Cantelmo

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本文提出利用元学习技术解决宏观基本图估计数据稀缺问题,通过多城市数据建模提升不同城市交通流预测性能。

Comments Version accepted for publication in Transportation Research Part C (before proof-reading)

Journal ref Learning to learn the macroscopic fundamental diagram using physics-informed and model agnostic machine learning. Transportation Research Part C: Emerging Technologies, 2026, 189, 105707

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10020 2026-05-12 cs.LG 57%

TrajDLM: Topology-Aware Block Diffusion Language Model for Trajectory Generation

TrajDLM:基于块扩散语言模型的拓扑感知轨迹生成框架

Wilson Wongso, Lihuan Li, Arian Prabowo, Xiachong Lin, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 TrajDLM结合块扩散模型与拓扑感知嵌入,实现高效且真实的轨迹生成,优于现有方法,在速度和细粒度相似性上表现优异,并在跨领域迁移中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL 57%

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08762 2026-05-12 cs.SD cs.LG 57%

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

Omni-DeepSearch:一种基于音频的多模态深度搜索基准

Tao Yu, yiming ding, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Xinming Wang, Xinlong Chen, Zhaolu Kang, Junhao Gong, Yuxuan Zhou, Haopeng Jin, Zhiqing Cui, Jiabing Yang, YiFan Zhang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA UCAS BAAI Peking University(北京大学) Tsinghua University(清华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG

AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 57%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL 57%

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12852 2026-05-11 cs.AI 57%

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning

WebClipper: 基于图的轨迹修剪高效进化网络代理

Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出WebClipper框架,通过图基修剪压缩网络代理轨迹,减少20%的工具调用次数并提升准确性,引入F-AE Score指标平衡精度与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08080 2026-05-08 hep-ph cs.LG physics.comp-ph stat.ML 57%

Towards AI-assisted Neutrino Flavor Theory Design

迈向AI辅助中微子味理论设计

Jason Benjamin Baretz, Max Fieg, Vijay Ganesh, Aishik Ghosh, V. Knapp-Perez, Jake Rudolph, Daniel Whiteson

机构 * Department of Physics and Astronomy, University of California, Irvine(加州大学 Irvine 分校物理与天文学系) Particle Theory Department, Fermilab(费米实验室粒子理论部门) Georgia Institute of Technology(佐治亚理工学院) Physics Division, Lawrence Berkeley National Laboratory(伯克利国家实验室物理部)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文提出AMBer框架,利用强化学习在物理软件管道中高效搜索模型空间,减少自由参数,验证了其在中微子味理论中的有效性。

Comments 28 pages, 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01574 2026-05-05 cs.LG 57%

Hybrid Quantum Reinforcement Learning with QAOA for Improved Vehicle Routing Optimization

混合量子强化学习与QAOA用于改进车辆路径优化

T. Satyanarayana Murthy, B. Swathi Sowmya, Santhosh Voruganti, Sai Varshini Giridi, Chaitanyya Pratap Agarwal, Vanteddu Akshitha

机构 * Chaitanya Bharathi Institute of Technology(恰伊坦尼亚·巴拉提技术学院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文提出一种结合QAOA的混合量子强化学习框架,用于解决车辆路径优化问题,展示更快收敛速度和更优解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01428 2026-05-05 cs.CL 57%

Hallucinations Undermine Trust; Metacognition is a Way Forward

幻觉削弱信任;元认知是前进的方向

Gal Yona, Mor Geva, Yossi Matias

机构 * Tel Aviv University(特拉维夫大学)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 研究指出,生成AI的幻觉问题源于知识边界扩展而非意识提升,提出通过元认知表达不确定性以提升可信度和能力。

Comments To appear in ICML 2026 (Position Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 57%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26523 2026-04-30 cs.SE 57%

RepoDoc: A Knowledge Graph-Based Framework to Automatic Documentation Generation and Incremental Updates

RepoDoc: 基于知识图谱的自动文档生成与增量更新框架

Dong Xu, Mingwei Liu, Xiwen Wang, Jianfeng Zhong, Zibin Zheng

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 RepoDoc通过构建仓库知识图谱,实现代码文档的自动化生成与增量更新,提升文档覆盖率和完整性,同时提高生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13942 2026-04-30 cs.CV cs.AI 57%

Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning

glance-or-gaze: 通过强化学习激励大 multimodal 模型适应性聚焦搜索

Hongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出 glanco-or-gaze 框架,通过强化学习使大 multimodal 模型主动规划视觉搜索,通过选择性注视和复杂度自适应强化学习提升复杂视觉查询性能。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11452 2026-04-28 quant-ph cs.AI 57%

Attention-Based Deep Reinforcement Learning for Qubit Allocation in Modular Quantum Architectures

基于注意力的深度强化学习在模块化量子架构中的量子比特分配

Enrico Russo, Maurizio Palesi, Davide Patti, Giuseppe Ascia, Vincenzo Catania

机构 * University of Catania(卡塔尼亚大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出利用深度强化学习方法,结合Transformer和图神经网络,高效解决量子电路编译与映射问题,减少核心间通信并提升求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 57%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22985 2026-04-28 cs.CL 57%

Uncertainty Quantification for LLM Function-Calling

大语言模型函数调用的不确定性量化

Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

机构 * University of Oxford(牛津大学) Apple(苹果公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 本文研究了大语言模型函数调用中不确定性量化的关键问题,发现多样本方法在自然语言问答中表现优异,但在函数调用场景中不如单样本方法有效,并提出利用函数调出输出特性改进现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI 57%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏