arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2606.15508 2026-06-16 cs.AI 新提交 57%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交 57%

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 57%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14945 2026-06-16 cs.LG 新提交 57%

Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation

记住,不要重读:用于令牌高效自主实验的有状态ReAct智能体

Faramarz Jabbarvaziri

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出基于LangGraph的有状态ReAct智能体,通过持久化状态和固定大小对话窗口,将自主实验的令牌成本从O(n²)降至O(1),在超参数调优和代码优化任务中分别减少90%和52%的令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10456 2026-06-16 cs.CR cs.AI 新提交 57%

The Distributed Detectability Band Against Marginal-Preserving Attacks

针对边际保持攻击的分布式可检测性带

Zhang Qinqin, Gao Yuze

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AI监控的边际保持攻击,通过高斯Copula AR(1)构造将危害编码在时间相关性中,证明分布形状监控器失效而时间相关性监控器有效,形成非空可检测性带。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13995 2026-06-15 cs.CL 新提交 57%

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Dialogue SWE-Bench: 对话驱动的编码智能体基准

Brendan King, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Dialogue SWE-Bench基准,通过用户模拟器评估编码智能体在对话中解决软件工程问题的能力,并引入模式引导智能体提升对话性能3-14%。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14601 2026-06-15 cs.LG cs.SY eess.SY math.OC stat.CO 新提交 57%

A Statistical and Machine Learning Framework for Operational Threshold Detection and Deployable Dispatch Controller Development in Hydrogen Multi-Energy Systems

氢多能系统中运行阈值检测与可部署调度控制器开发的统计与机器学习框架

Shadi Heenatigala, Hasanika Samarasinghe

机构 * Antioch College(安提阿学院) The Open University of Sri Lanka(斯里兰卡开放大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出统计与机器学习框架,利用一年高分辨率运行数据表征氢多能系统,通过统计分析和随机森林揭示非线性动态,并利用强化学习优化调度。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07040 2026-06-15 cs.CL 新提交 57%

Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

超越评分标准:面向奖励建模的探索引导评估技能

Xing Yue, Linjuan Wu, Daoxin Zhang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 提出Eval-Skill方法,通过探索引导合成可复用的领域级评估技能,以替代每查询生成评分标准,在RewardBench 2上使Qwen3-8B和DeepSeek-V4-Flash分别提升13.44%和18.51%。

Comments 24 pages, 6 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13310 2026-06-12 cs.CL cs.HC 新提交 57%

RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

RogueAI: 一种用于检测对话中授权AI欺骗的逆向图灵测试

Sara Candussio, Emanuele Ballarin, Lorenzo Bonin, Sandro Junior Della Rovere, Luca Bortolussi

机构 * AILab, MIGe, University of Trieste(的里雅斯特大学) Computational Statistics and Machine Learning, Istituto Italiano di Tecnologia(意大利理工学院) DIA, University of Trieste(的里雅斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出RogueAI,一种通过玩家与两个LLM代理的对话游戏来检测授权欺骗的逆向图灵测试,并引入AutoRogueAI扩展。实验发现简单启发式方法准确率75.6%,而人类仅56.6%,表明人类忽略关键信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13079 2026-06-12 cs.CR cs.AI 新提交 57%

The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

大型语言模型驱动的AI系统中自主渗透能力的涌现

Jiaqi Luo, Jiarun Dai, Zhile Chen, Jia Xu, Weibing Wang, Yawen Duan, Brian Tse, Geng Hong, Xudong Pan, Yuan Zhang, Min Yang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Concordia AI Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有评估方法不透明、场景简化等问题,构建包含两级目标服务器和通用代理框架的自主渗透评估体系,测试19个LLM发现成功率10.7%-69.3%,且能力随模型整体能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12871 2026-06-12 cs.AI 新提交 57%

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

DailyReport: 一个用于评估搜索代理在日常搜索任务上的开放式基准

Jingxuan Han, Wei Liu, Mingyang Zhu, Youpeng Wang, Ziwen Wang, Lin Qiu, Xuezhi Cao, Xunliang Cai, Zheren Fu, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出DailyReport基准,包含150个开放式日常搜索任务和3546个级联评分标准,通过分解子任务和维度评估,揭示当前搜索代理系统仍未能满足用户期望。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12821 2026-06-12 cs.AI cs.ET 新提交 57%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12747 2026-06-12 cs.AI 新提交 57%

Prefill Awareness in Large Language Models

大型语言模型中的预填充感知

Andy Wang, Parv Mahajan, David Demitri Africa, Alexandra Souly, Jordan Taylor, Robert Kirk

机构 * Constellation University of Wisconsin-Madison(威斯康星大学麦迪逊分校星座研究所) Constellation Georgia Institute of Technology(佐治亚理工学院星座研究所) UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究大型语言模型能否识别并响应其助手消息被预填充或篡改,发现前沿模型具有显著预填充感知能力,可能影响安全评估方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12420 2026-06-12 cs.CY cs.AI 新提交 57%

Eigenism: Ethics for a Human-AI Future

Eigenism:人类与人工智能未来的伦理学

Dan Hendrycks

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Eigenism伦理框架,将身份视为分级分布的信息模式,通过加权求和评估AI的福祉,并推广至人类,为AI对齐提供“身份工程”新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11625 2026-06-11 cs.LG 新提交 57%

TimeRouter: Efficient and Adaptive Routing of Time-Series Foundation Models

TimeRouter: 时间序列基础模型的高效自适应路由

Kanghui Ning, Yushan Jiang, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

机构 * University of Connecticut(康涅狄格大学) Salesforce AI Research JP Morgan AI Research(摩根大通人工智能研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 提出TimeRouter框架,通过轻量判别路由、选择性门控和集成回退实现时间序列基础模型的自适应选择,无需LLM推理,在GIFT-EVAL榜单取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10799 2026-06-10 cs.AI 新提交 57%

Evaluating Research-Level Math Proofs via Strict Step-Level Verification

通过严格的步骤级验证评估研究级数学证明

Yifeng Sun

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出严格步骤级验证框架,通过约束推理上下文和定理来源,解决大模型在复杂数学证明验证中的“上下文中毒”问题,在FirstProof挑战数据集上优于全局评估,并揭示基准中的隐含歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10611 2026-06-10 cs.LG cs.CV 新提交 57%

Geometry-Aware Reinforcement Learning for 2D Irregular Nesting

几何感知强化学习用于二维不规则排样

Auguste Lehuger, Guillaume Henon-Just

机构 * Valeo Brain(法雷奥大脑)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出Polygons Transformer架构与组合优化强化学习框架,使智能体从数据中学习几何先验,在二维不规则排样中达到与最先进启发式算法Sparrow竞争的面积利用率。

Comments 15 pages, 4 figures, 5 tables. Under review at the European Workshop on Reinforcement Learning (EWRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10314 2026-06-10 cs.AI 新提交 57%

Mobility Anomaly Generation using LLM-Driven Behavior with Kinematic Constraints

基于大语言模型驱动行为与运动约束的移动异常生成

Yueyang Liu, Joon-Seok Kim, Andreas Züfle

机构 * Emory University, Atlanta, USA(埃默里大学,亚特兰大,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出端到端生成框架,结合大语言模型注入语义异常与地图约束路由重建,合成带标注的真实轨迹异常数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10286 2026-06-10 cs.AI 新提交 57%

Sim2Schedule: A Simulator-Guided LLM Framework for Autonomous Open-Pit Mine Scheduling

Sim2Schedule: 一种模拟器引导的LLM框架用于自主露天矿调度

Mustavi Ibne Masum, Thiago Eustaquio Alves de Oliveira, Mahzabeen Emu

机构 * Department of Computer Science, Lakehead University(湖头大学计算机科学系) Quantum Communications and Computing Research Center and Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学量子通信与计算研究中心及电气与计算机工程系) Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出模拟器引导的LLM框架,将地质约束编码到动作生成中,零样本生成可解释调度方案,在保持线性计算时间下恢复MILP最优NPV的94%-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09878 2026-06-10 cs.LG 新提交 57%

FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

FailureScope: 语言模型弱点的跨机制行为诊断

Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出FailureScope方法,通过跨模型通过/失败模式聚类评估探针,在单轮基准、多轮对话和对抗性代理攻击三种机制下稳定生成可解释的失败分类,实现高效任务采样和跨模型失败预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 57%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08849 2026-06-09 cs.AI 新提交 57%

A Resilience-as-a-Service assessment framework for coordinated disruption response in interdependent urban transit systems

面向城市交通系统协同中断响应的弹性即服务评估框架

Sara Jaber, S. M. Hassan Mahdavi, Neila Bhouri, Mostafa Ameli

机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08168 2026-06-09 cs.CR cs.AI 新提交 57%

Closing the Sim-to-Real Gap: An Evaluation Framework for Autonomous Cyber Defense Configuration of Commercial EDR

弥合模拟到现实的差距:商业EDR自主网络防御配置评估框架

Kerri Prinos, Lilianne Brush

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个针对商业EDR自主防御智能体的评估框架,通过GOAD实验室与微软Defender XDR的实例化测试,揭示模拟和开源评估无法发现的三个关键差距。

Comments 12 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08106 2026-06-09 cs.AI cs.MA 新提交 57%

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

PACE: 自演化智能体的任意有效接受测试

Zayx Shawn

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07229 2026-06-08 cs.SD cs.CL cs.MM 新提交 57%

MMAE: A Massive Multitask Audio Editing Benchmark

MMAE:大规模多任务音频编辑基准

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao, Wenming Tu, Tianrui Wang, Auden, Qi Chen, Wenxi Chen, Jiaying Chi, Yanru Huo, Zixuan Jiang, Xiquan Li, Yalin Li, Junxi Liu, Minghao Liu, Binghao Qiang, Yijia Shan, Zheshu Song, Tian Tan, Zixiang Wang, Zeyu Xie, Zhifei Xie, Xiaoyu Xing, Qixiang Xu, Chen Yang, Guanrou Yang, Shan Yang, Yifan Yang, Steve Yves, Haotian Zhang, Haina Zhu, Kai Yu, Liefeng Bo, Eng-Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队) Tianjin University(天津大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出首个面向通用指令音频编辑的综合评估基准MMAE,涵盖7种音频模态、6级任务复杂度和8种操作类型,通过2000个样本和基于评分标准的评估框架揭示当前模型在精确执行和结构鲁棒性上的严重不足。

Comments Open-Source at https://github.com/ddlBoJack/MMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交 57%

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 56%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 Agent评测 :agent(abstract,comments)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15613 2026-07-20 cs.GT 新提交 56%

Fair Allocation of Divisible Goods under Non-Linear Valuations

非线性估值下可分物品的公平分配

Haris Aziz, Zixu He, Xinhang Lu, Kaiyang Zhou

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 研究非线性估值下可分物品的公平分配问题,针对最大最小份额保证设计算法,给出\(\frac{1}{2n - 1}\)-MMS分配,证明对MMS的近似比例几乎是紧的;还研究无嫉妒性,证明其检查存在性对\(n\)个主体和至少三种物品是NP难的,对单个物品给出多项式时间算法。

Comments Appears in the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 50%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏