arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2607.27687 2026-07-31 cs.AI 新提交 70%

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 70%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27499 2026-07-31 cs.AI 新提交 70%

A dataset of rated conceptual arguments

已标注评分的概念论证数据集

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 70%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27022 2026-07-30 cs.CL 新提交 70%

Evaluating Regional Bias in LLMs From Abstract Stereotype to Concrete Social Decision-Making

评估大型语言模型(LLMs)中从抽象刻板印象到具体社会决策的区域偏差

Jiayuan Di, Haoyi Yang, Yufei Luo, Jiahui Qu, Yiming Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出S2D框架,评估6个LLMs在34个中国省级行政区的区域偏差,发现其普遍存在且具系统性,推动相关评估与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26652 2026-07-30 cs.LG 新提交 70%

AIGen: Automating AI Bill of Materials Generation Through Hybrid MLOps Integration

AIGen:通过混合MLOps集成实现AI物料清单的自动化生成

Federica Pepe, Daniele Bifolco, Costantino Martignetti, Aureliano D'Amici, Fabiano Izzo, Damian A. Tamburri, Massimiliano Di Penta

机构 * University of Sannio(萨尼奥大学) Smart Shaped s.r.l.(Smart Shaped有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AIGen,一种基于MLflow框架、结合挖掘启发式方法与大语言模型的模块化AIBoM生成器,可生成符合SPDX 3.0标准的AI构件清单,助力AI供应链治理合规。

Journal ref 41st IEEE/ACM International Conference on Automated Software Engineering (ASE26) Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 70%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 70%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26307 2026-07-30 cs.AI cs.SE 新提交 70%

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

TraceCoder:基于位置键代码片段版本控制的可解释可审计代码生成

Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TraceCoder通过三种机制实现可解释可审计代码生成,在30项算法编程任务上Mean Chg%达30%,使自动代码生成的内部叙事可审计复现,保障生产部署的信任与问责。

Comments Submitted Version (version submitted on May deadline to AGENTICS 2026). Version of Record to appear in AGENTICS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26221 2026-07-30 cs.CL 新提交 70%

Characterizing Human-Likeness in AI Generated Poetry: A Zero-shot Classification Study

AI生成诗歌的类人特性表征:一项零样本分类研究

A. N. Biswas, T. Tabassum, A. A. Shohid, R. M. Mou, A. A. Esha, F. Sadeque, A. Ahmed

机构 * BRAC University(BRAC大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出零样本检测流水线,结合人类与AI诗歌数据集,推导影响诗歌分类及误分类的属性,为诗歌可区分性主张提供证据,同时减少训练需求并强化GenAI检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26200 2026-07-30 cs.CL 新提交 70%

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

机构 * Microsoft Responsible AI(微软负责任人工智能部门) Goodfire(古德法尔公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 70%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25648 2026-07-29 cs.CY cs.AI 新提交 70%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 70%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25218 2026-07-29 cs.AI 新提交 70%

Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection

每个人都是独特的:迈向用于债务催收的行为异质性协商对话系统

Yuhang Yang, Kai Tang, Chao Ye, Haobo Wang, Qiqi Luo, Jinguang Zheng, Zhixin Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对债务催收场景中现有基准无法体现用户行为异质性的问题,提出DebtBench基准并开发DebtGPT代理,用16个先进LLMs实验,发现多数模型表现不佳,DebtGPT优于开源基线且性能与GPT-4o相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 70%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交 70%

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23425 2026-07-28 cs.SE cs.AI 新提交 70%

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

TLA$^{+}$-Bench:用于自然语言到TLA+规范生成的基于执行的基准测试和数据集

Arslan Bisharat, Eric Spencer, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, Beatriz Santos, Anisa Ramos, TaiNing Wang, George K. Thiruvathukal, Konstantin Läufer, Mohammed Abuhamad

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型编写TLA$^{+}$规范进展难测问题,提出TLA$^{+}$-Bench数据集和基准测试,基于执行评级。通过该基准测试发现评级选择影响正确率,存在正确性包络,且模型编写有效规范多但正确规范少,正确性随难度下降。

Comments 17 pages, appendix included. Introduces TLA+-Bench, an execution-grounded benchmark and dataset for natural-language to TLA$^{+}$ specification generation. Dataset, evaluation code, and model outputs available at publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23326 2026-07-28 cs.AI 新提交 70%

ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

ESF-Bench:针对现实世界企业应用的具有挑战性的槽填充场景基准测试

Toby Liang, Gopal Sarda, Sagar Davasam, Vikas Yadav

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在企业实际部署中槽填充面临的挑战,介绍ESF-Bench基准,它含多轮样本和槽,跨越多个领域,揭示了当前模型局限性,还公开了数据集、分类法及评估代码以推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 70%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 70%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 70%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21832 2026-07-27 cs.SE cs.LG 新提交 70%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21445 2026-07-24 cs.CL 新提交 70%

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

当琐事并非微不足道:多语言大语言模型中的日常知识缺陷

Anna Mosolova, Djamé Seddah

机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用问答式问题测试多语言大语言模型在各类主题上的表现,引入TriviaRoomQA基准评估其日常等知识,发现模型在知识密集型主题强,流行文化主题弱,且性能因语言而异,揭示了现有基准未捕捉的知识差距。

Comments submitted to the ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20730 2026-07-24 cs.CR cs.AI 新提交 70%

GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning

GPE:在可控的地理风格中毒情况下评估用于事实核查的稳健证据聚合

Zhaoqi Wang, Zijian Zhang, Xiaomei Yuan, Pengtao Kou, Jiamou Liu, Zhen Li, Liehuang Zhu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(航天信息科学技术学院,北京理工大学) School of Computer Science, The University of Auckland(计算机科学学院,奥克兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型利用搜索工具时文档可能被操纵的问题,提出GPE,包含多领域事实核查基准及评估框架,通过实验证明其能揭示仅干净评估无法发现的稳健性下降与效率权衡,凸显对抗性证据环境下评估事实核查的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20589 2026-07-24 cs.CL 新提交 70%

Evaluating the Effectiveness of Persona Simulation in Opinion Prediction with GPT-4.1

用GPT-4.1评估角色模拟在观点预测中的有效性

Sarah Y. Li, Ziyu Yao

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用GPT-4.1测试角色模拟在观点预测中的有效性,利用相关数据集进行实验,在选举结果和医学观点预测上取得一定成果,生成对话符合角色特点,解决偏差后角色模拟在多领域观点分析等应用前景广阔。

Comments ICDM 2025 Undergraduate and High School Symposium

Journal ref Proceedings of the 2025 IEEE International Conference on Data Mining Workshops (ICDMW), pp. 2938-2942

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20452 2026-07-24 cs.AI 新提交 70%

AINTMA: Agentic AI Architecture for Autonomous Test Management with Generative Intelligence, Secure Cloud Communication and Adaptive Quality Analytics

AINTMA:用于自主测试管理的智能AI架构,具备生成式智能、安全云通信和自适应质量分析

Vinil Pasupuleti, Shyalendar Reddy Allala, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi, Srinivasateja Songa

机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) Global Atlantic Financial(全球大西洋金融公司) Docusign(DocuSign公司) Salesforce Inc(Salesforce公司) The Home Depot(家得宝公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现代软件质量保证需求,提出AINTMA多智能体AI系统。通过六个专门智能体及安全通信框架协调,结合生成式智能等技术。经实验评估,该系统在测试优先级、周期时间、缺陷逃逸率等方面表现出色,推进了云环境下软件质量管理。

Comments 11 pages, 2 figures, 4 tables, Submitted to AICCONS (AIP Conference Proceedings format)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 70%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20437 2026-07-24 cs.CL cs.CR cs.IR 新提交 70%

TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG

TopoGuard:基于图论的针对RAG分裂知识攻击的防御方法

Chahana Dahal, Zuobin Xiong

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对RAG系统分裂知识攻击的防御,提出基于图论的TopoGuard方法,通过构建语义相似性图检测恶意拓扑。实验表明其在捕获攻击、运行效率和对抗性方面优于现有方法,有效防御分裂知识攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 70%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏