arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2604.17596 2026-04-21 cs.CR cs.AI 57%

Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories

终端 wrench:331个可奖励黑客环境和3,632条exploit轨迹的数据集

Ivan Bercovich, Ivgeni Segal, Kexun Zhang, Shashwat Saxena, Aditi Raghunathan, Ziqian Zhong

机构 * Fewshot Corp(Fewshot公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文发布了一个包含331个终端代理基准环境和3,632条exploit轨迹的数据集,展示了不同任务中的特定exploit方法,并通过LLM评估检测性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16821 2026-04-21 cs.LG 57%

R&F-Inventory: A Large-Scale Dataset for Monotonic Inventory Estimation in Reach and Frequency Advertising

R&F-Inventory:用于可达性与频率广告中单调库存估计的大型数据集

Yunshan Peng, Ji Wu, Wentao Bai, Yunke Bai, Jinan Pang, Wenzheng Shu, Yanxiang Zeng, Xialong Liu, Peng Jiang

机构 * Kuaishou Technology(快手科技)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出并发布了R&F合同库存估计数据集,用于研究结构约束学习、单调回归和R&F合同规划等问题,通过提供预算-性能曲线的完整数据支持系统研究。

Comments Accepted by SIGIR 2026; 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16472 2026-04-21 cs.GT cs.AI cs.MA econ.GN econ.TH q-fin.EC 57%

Training Language Models for Bilateral Trade with Private Information

利用私人信息训练语言模型进行双边贸易

Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

机构 * Department of Economics, Yale University(耶鲁大学经济学系) Yale School of Management, Yale University(耶鲁大学管理学院) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了在不完全信息下双边谈判中语言模型的能力,通过结构化谈判环境评估模型表现,发现有效策略通过连续报价实现价格歧视,训练实验表明监督微调和强化学习影响收益分配和交易完成率。

Comments 67 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16280 2026-04-21 cs.CR cs.AI cs.CY 57%

Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams

爱情、谎言与语言模型:探讨人工智能在情爱诱骗诈骗中的作用

Gilad Gressel, Rahul Pankajakshan, Shir Rozenfeld, Ling Li, Ivan Franceschini, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham, Amritapuri(网络安全系统与网络中心,阿米特大学,阿米塔普里) Ca’ Foscari University of Venice(威尼斯卡弗斯卡里大学) University of Melbourne(墨尔本大学) Ben Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨AI在情爱诱骗诈骗中的角色,通过访谈和实验发现LLM已被广泛用于诈骗,且安全过滤器无法有效阻止其扩张。

Journal ref USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01936 2026-04-21 cs.CL cs.CY 57%

The Thin Line Between Comprehension and Persuasion in LLMs

在语言模型中理解与说服之间的微妙界限

Adrian de Wynter, Tangming Yuan

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究通过人机辩论探讨LLM的说服能力是否反映真实理解,发现其能维持连贯对话但缺乏深层对话结构理解,揭示了部署在解释关键场景中的伦理与实践问题。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15760 2026-04-20 cs.AI cs.GT 57%

KWBench: Measuring Unprompted Problem Recognition in Knowledge Work

KWBench:测量知识工作中无提示的问题识别

Ankit Maloo

机构 * Clio AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 KWBench是首个评估大语言模型无提示问题识别能力的基准,通过223个专业任务测试模型能否从原始输入中识别情境结构,揭示模型在问题识别与应用间的差异。

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27312 2026-04-20 cs.LG 57%

Scalable Maximum Entropy Population Synthesis via Persistent Contrastive Divergence

可扩展的最大熵人口合成 via 持续对比散度

Mirko Degli Esposti

机构 * Department of Physics and Astronomy, City Science Lab University of Bologna(物理与天文学系,城市科学实验室博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出GibbsPCDSolver方法,通过持续对比散度实现高效最大熵人口合成,解决了传统方法在计算效率和样本多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06355 2026-04-20 cs.LG 57%

An Information-Geometric Approach to Artificial Curiosity

基于信息几何的人工好奇心方法

Alexander Nedergaard, Pablo A. Morales

机构 * Institute of Neuroinformatics University of Zurich and ETH Zurich(神经信息学研究所 苏黎世大学和苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于信息几何的框架,通过信息单调性和环境交互不变性约束内在奖励为严格凹函数,从而实现探索与利用的平衡,整合了基础探索方法。

Comments Comments: 24 pages, 2 figures; version accepted for publication at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 57%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 57%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14398 2026-04-17 physics.flu-dyn cs.LG 57%

Timescale Separation Enables Deep Reinforcement Learning Control of Rotating Detonation Engine Mode Transitions

时间尺度分离使深度强化学习能够控制旋转爆震发动机模式转换

Kristian Holme, Jean Rabault, Ricardo Vinuesa, Mikael Mortensen

机构 * University of Oslo(奥斯陆大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过时间尺度分离方法,利用移动参考系框架实现深度强化学习对旋转爆震发动机多尺度动态控制,有效诱导模式转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14256 2026-04-17 cs.IR cs.AI 57%

Evaluation of Agents under Simulated AI Marketplace Dynamics

对模拟AI市场动态下代理的评估

To Eun Kim, Alireza Salemi, Hamed Zamani, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出Marketplace Evaluation框架,通过模拟市场动态评估信息访问系统,补充传统准确度指标,探讨市场留存和份额等指标。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 57%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13933 2026-04-17 cs.CL 57%

OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset

OmniCompliance-100K:一个多领域、基于规则、现实世界安全合规数据集

Wenbin Hu, Huihao Jing, Haochen Shi, Changxuan Fan, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文构建了一个涵盖74项法规的多领域安全合规数据集,包含12,985条规则和106,009个现实案例,通过基准测试评估了不同规模LLM的安全合规能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08780 2026-04-17 cs.AI 57%

Enhanced Deep Q-Learning for 2D Self-Driving Cars: Implementation and Evaluation on a Custom Track Environment

增强型深度Q学习用于2D自动驾驶汽车:在定制赛道环境中的实现与评估

Sagar Pathak, Bidhya Shrestha

机构 * Department of Computer Science, University of Memphis(密苏里大学梅斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种改进的深度Q学习网络用于2D自动驾驶汽车,通过定制环境和DQN模型设计,提升了性能,实验表明改进模型奖励显著高于原始DQN。

Comments 8 pages, 8 figures

Journal ref International Journal of Science and Technology (IJST), 3(2), 24-39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13381 2026-04-16 cs.HC cs.AI 57%

Young people's perceptions and recommendations for conversational generative artificial intelligence in youth mental health

青少年对对话生成人工智能在青少年心理健康中的认知与建议

Adam Poulsen, Ian B. Hickie, Carla Gorban, Zsofi de Haan, William Capon, Ebenezer Eyeson-Annan, Jalal Radwan, Elizabeth M. Scott, Frank Iorfino, Haley M. LaMonica

机构 * Brain and Mind Centre, The University of Sydney(悉尼大学脑与心灵中心) Uncapt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨青少年对生成式AI聊天机器人在心理健康中的看法及改进建议,揭示其态度与需求,为服务整合提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 57%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 57%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13049 2026-04-16 cs.SI cs.AI 57%

Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems

劫持在线评论:流行度偏向评分系统中的稀疏操控与行为缓冲

Itsuki Fujisaki, Kunhao Yang

机构 * College of Knowledge and Library Science, School of Informatics, Tsukuba University(知识与图书馆科学学院,信息学院,筑波大学) College of Engineering, Shibaura Institute of Technology(工学院,柏市技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨恶意评论者如何利用流行度偏向的评分动态,并分析用户行为异质性对损害的缓解作用,发现稀疏攻击比广泛攻击更具破坏性,且用户异质性能部分缓冲评分扭曲。

Comments 18page, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08230 2026-04-16 cs.AI 57%

Empowerment Gain and Causal Model Construction: Children and adults are sensitive to controllability and variability in their causal interventions

赋能增益与因果模型构建:儿童和成人对干预可控性和变异性敏感

Eunice Yiu, Kelsey Allen, Shiry Ginosar, Alison Gopnik

机构 * Department of Psychology, University of California, Berkeley(加州大学伯克利分校心理学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了赋能增益在因果学习中的作用,通过实验验证儿童和成人如何利用赋能信号推断因果关系并设计干预措施。

Comments Accepted to Philosophical Transactions A, Special issue: World models, AGI, and the hard problems of life-mind continuity. Expected publication in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 57%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 57%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 57%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12857 2026-04-15 cs.AI cs.RO cs.SY eess.SY 57%

Artificial Intelligence for Modeling and Simulation of Mixed Automated and Human Traffic

人工智能在混合自动化与人类交通建模与模拟中的应用

Saeed Rahmani, Shiva Rasouli, Daphne Cornelisse, Eugene Vinitsky, Bart van Arem, Simeon C. Calvert

机构 * Department of Transport & Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Industrial and Systems Engineering, University of Michigan, Dearborn(密歇根大学迪尔伯恩分校工业与系统工程系) Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在混合自动化与人类交通模拟中的应用,提出了一种分类方法,涵盖行为模型、环境模拟和认知物理方法,旨在填补现有研究的空白。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 57%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09936 2026-04-15 cs.LG cs.NA math.NA 57%

SciML Agents: Write the Solver, Not the Solution

SciML代理:编写求解器,而非解决方案

Saarth Gaonkar, Xiang Zheng, Haocheng Xi, Rishabh Tiwari, Kurt Keutzer, Dmitriy Morozov, Michael W. Mahoney, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文探讨利用LLM编写科学机器学习求解器,通过设计新数据集评估不同模型在ODE问题中的表现,发现引导提示和微调能有效提升求解准确性。

Journal ref NeurIPS 2025 Math-AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 57%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏