arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2604.14829 2026-04-17 cs.AI 57%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14398 2026-04-17 physics.flu-dyn cs.LG 57%

Timescale Separation Enables Deep Reinforcement Learning Control of Rotating Detonation Engine Mode Transitions

时间尺度分离使深度强化学习能够控制旋转爆震发动机模式转换

Kristian Holme, Jean Rabault, Ricardo Vinuesa, Mikael Mortensen

机构 * University of Oslo(奥斯陆大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过时间尺度分离方法,利用移动参考系框架实现深度强化学习对旋转爆震发动机多尺度动态控制,有效诱导模式转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14256 2026-04-17 cs.IR cs.AI 57%

Evaluation of Agents under Simulated AI Marketplace Dynamics

对模拟AI市场动态下代理的评估

To Eun Kim, Alireza Salemi, Hamed Zamani, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出Marketplace Evaluation框架,通过模拟市场动态评估信息访问系统,补充传统准确度指标,探讨市场留存和份额等指标。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 57%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13933 2026-04-17 cs.CL 57%

OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset

OmniCompliance-100K:一个多领域、基于规则、现实世界安全合规数据集

Wenbin Hu, Huihao Jing, Haochen Shi, Changxuan Fan, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文构建了一个涵盖74项法规的多领域安全合规数据集,包含12,985条规则和106,009个现实案例,通过基准测试评估了不同规模LLM的安全合规能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08780 2026-04-17 cs.AI 57%

Enhanced Deep Q-Learning for 2D Self-Driving Cars: Implementation and Evaluation on a Custom Track Environment

增强型深度Q学习用于2D自动驾驶汽车:在定制赛道环境中的实现与评估

Sagar Pathak, Bidhya Shrestha

机构 * Department of Computer Science, University of Memphis(密苏里大学梅斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种改进的深度Q学习网络用于2D自动驾驶汽车,通过定制环境和DQN模型设计,提升了性能,实验表明改进模型奖励显著高于原始DQN。

Comments 8 pages, 8 figures

Journal ref International Journal of Science and Technology (IJST), 3(2), 24-39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13381 2026-04-16 cs.HC cs.AI 57%

Young people's perceptions and recommendations for conversational generative artificial intelligence in youth mental health

青少年对对话生成人工智能在青少年心理健康中的认知与建议

Adam Poulsen, Ian B. Hickie, Carla Gorban, Zsofi de Haan, William Capon, Ebenezer Eyeson-Annan, Jalal Radwan, Elizabeth M. Scott, Frank Iorfino, Haley M. LaMonica

机构 * Brain and Mind Centre, The University of Sydney(悉尼大学脑与心灵中心) Uncapt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨青少年对生成式AI聊天机器人在心理健康中的看法及改进建议,揭示其态度与需求,为服务整合提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 57%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 57%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13049 2026-04-16 cs.SI cs.AI 57%

Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems

劫持在线评论:流行度偏向评分系统中的稀疏操控与行为缓冲

Itsuki Fujisaki, Kunhao Yang

机构 * College of Knowledge and Library Science, School of Informatics, Tsukuba University(知识与图书馆科学学院,信息学院,筑波大学) College of Engineering, Shibaura Institute of Technology(工学院,柏市技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨恶意评论者如何利用流行度偏向的评分动态,并分析用户行为异质性对损害的缓解作用,发现稀疏攻击比广泛攻击更具破坏性,且用户异质性能部分缓冲评分扭曲。

Comments 18page, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08230 2026-04-16 cs.AI 57%

Empowerment Gain and Causal Model Construction: Children and adults are sensitive to controllability and variability in their causal interventions

赋能增益与因果模型构建:儿童和成人对干预可控性和变异性敏感

Eunice Yiu, Kelsey Allen, Shiry Ginosar, Alison Gopnik

机构 * Department of Psychology, University of California, Berkeley(加州大学伯克利分校心理学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了赋能增益在因果学习中的作用,通过实验验证儿童和成人如何利用赋能信号推断因果关系并设计干预措施。

Comments Accepted to Philosophical Transactions A, Special issue: World models, AGI, and the hard problems of life-mind continuity. Expected publication in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 57%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 57%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 57%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12857 2026-04-15 cs.AI cs.RO cs.SY eess.SY 57%

Artificial Intelligence for Modeling and Simulation of Mixed Automated and Human Traffic

人工智能在混合自动化与人类交通建模与模拟中的应用

Saeed Rahmani, Shiva Rasouli, Daphne Cornelisse, Eugene Vinitsky, Bart van Arem, Simeon C. Calvert

机构 * Department of Transport & Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Industrial and Systems Engineering, University of Michigan, Dearborn(密歇根大学迪尔伯恩分校工业与系统工程系) Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在混合自动化与人类交通模拟中的应用,提出了一种分类方法,涵盖行为模型、环境模拟和认知物理方法,旨在填补现有研究的空白。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 57%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA 57%

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 57%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22830 2026-04-14 cs.CL 57%

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

ChatInject: 利用聊天模板对LLM代理进行提示注入

Hwan Chang, Yonghyun Jun, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究提出ChatInject攻击,通过模拟聊天模板诱导LLM代理执行恶意指令,实验显示其攻击成功率显著高于传统方法,且现有防御措施对多轮对话变种效果有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10968 2026-04-14 cs.CL 57%

YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents

YIELD:信息提取代理的大规模数据集和评估框架

Victor De Lima, Grace Hui Yang

机构 * InfoSense Lab, Georgetown University(乔治城大学信息感知实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出YIELD数据集和评估框架,用于研究信息提取代理,通过2600万token的对话数据提升模型对真实信息提取行为的对齐能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10409 2026-04-14 cs.CV cs.AI 57%

IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly

IMPACT:一个多粒度工业装配中的人类过程动作理解数据集

Di Wen, Zeyun Zhong, David Schneider, Manuel Zaremski, Linus Kunzmann, Yitian Shi, Ruiping Liu, Yufan Chen, Junwei Zheng, Jiahang Li, Jonas Hemmerich, Qiyi Tong, Patric Grauberger, Arash Ajoudani, Danda Pani Paudel, Sven Matthiesen, Barbara Deml, Jürgen Beyerer, Luc Van Gool, Rainer Stiefelhagen, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院) Italian Institute of Technology(意大利理工学院) INSAIT, Sofia University(索非亚大学INSAIT研究所)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 IMPACT数据集通过同步五视角RGB-D数据,提供真实工业装配场景下的多粒度人类过程动作理解,包含112次试验,结合部分序优先级图、六类异常分类和NASA-TLX测量,揭示了单任务基准无法捕捉的真实部署条件下的局限性。

Comments 9 pages, 2 figures, benchmark and dataset are available at https://github.com/Kratos-Wen/IMPACT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10182 2026-04-14 cs.AI 57%

Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision

基于信用的ICPC风格编码:当代理必须为每个决定付费

Lingfeng Zhou, Junhao Shi, Jin Gao, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出USACOArena,通过引入严格的信用经济机制,使代理在决策时考虑成本,解决资源受限下的高效编码问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09937 2026-04-14 cs.AI 57%

HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks

HealthAdminBench: 评估基于计算机使用的代理在医疗管理任务上的性能

Suhana Bedi, Ryan Welch, Ethan Steinberg, Michael Wornow, Taeil Matthew Kim, Haroun Ahmed, Peter Sterling, Bravim Purohit, Qurat Akram, Angelic Acosta, Esther Nubla, Pritika Sharma, Michael A. Pfeffer, Sanmi Koyejo, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Kinetic Systems Stanford Health Care(斯坦福医疗保健)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出HealthAdminBench,通过四个真实GUI环境和135个专家定义任务,评估CUA在医疗行政流程中的性能,发现端到端可靠性较低,最佳代理仅达成36.3%的任务成功率。

Comments 24 pages, 5 figures, 5 tables. Benchmark paper introducing 4 simulated environments, 135 tasks, and 1,698 evaluation points for healthcare administrative computer-use agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09556 2026-04-14 cs.DC cs.AI 57%

Para-B&B: Load-Balanced Deterministic Parallelization of Solving MIP

Para-B&B: 解决MIP问题的负载均衡确定性并行化

Jinyu Zhang, Di Huang, Yue Liu, Shuo Wang, Zhenyu Pu, Zhiyuan Liu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出Para-B&B,通过AI驱动的负载平衡机制和数据并行架构,实现HiGHS求解器的确定性并行化,实验显示在80个MIPLIB 2017实例上取得2.17的几何平均加速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22887 2026-04-14 cs.CL 57%

Infusing Theory of Mind into Socially Intelligent LLM Agents

将心智理论融入社交智能的大语言模型代理

EunJeong Hwang, Yuwei Yin, Giuseppe Carenini, Peter West, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出ToMAgent,通过结合心智理论与对话前瞻训练,提升对话效果和目标达成能力,实验表明其在社交交互评估基准中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09413 2026-04-13 cs.CY cs.AI 57%

Yes, But Not Always. Generative AI Needs Nuanced Opt-in

是的,但并非总是如此。生成式AI需要细致的明确同意

Wiebke Hutiri, Morgan Scheuerman, Shruti Nagpal, Austin Hoag, Alice Xiang

机构 * Sony AI(索尼人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨生成式AI中单一同意模式的不足,提出在推理阶段实施细致的明确同意机制,以平衡权利持有者与AI开发者之间的权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21588 2026-04-13 q-bio.NC cs.LG 57%

Contribution of task-irrelevant stimuli to drift of neural representations

任务无关刺激对神经表示漂移的贡献

Farhad Pashakhanloo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了任务无关刺激如何通过学习噪声导致神经表示的长期漂移,探讨了不同架构和学习规则下的漂移机制及任务相关性。

Comments NeurIPS 2025 (camera ready)

Journal ref Advances in Neural Information Processing Systems (NeurIPS) 39 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 57%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏