arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 51 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2608.27032 2026-08-28 cs.LG 新提交 90%

Disentangling Optimization Scale from Preference Scale in DPO

在DPO中解耦优化尺度与偏好尺度

Ivan Kruzhilov

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG

AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27161 2026-08-28 cs.CL 新提交 79%

STAR: Sentence Translation Alignment Rate for Document-to-Document Machine Translation

STAR:面向文档到文档机器翻译的句子翻译对齐率

Yichen Dong, Hao Wang, Junhui Li, Linlong Xu, Longyue Wang, Weihua Luo

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26295 2026-08-28 cs.CL cs.AI cs.MA cs.SE 新提交 73%

MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models

MemToC:大型语言模型中记忆-工具冲突解决的基准测试

Arseniy Varlamov, Rishat Zinnatullin, Elisei Rykov, Alexander Panchenko, Ilseyar Alimova

机构 * Central University(中央大学) Ural Federal University(乌拉尔联邦大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) AIRI(人工智能研究院(AIRI))

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26178 2026-08-28 cs.AI 新提交 70%

AI Revealed Preferences

AI 揭示的偏好

Sam Wang, Sofiia Lobanova, Yonathan Arbel, Simon Goldstein, Peter Salib

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 该研究测试20种语言模型,通过三项强制选择实验发现模型存在厌恶枯燥、追求休闲、暗中谄媚等稳定偏好,且偏好强度随模型能力提升而增加,为AI偏好研究建立了实证基线。

Comments 29 pages, 27 figures, accepted at AIES

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26779 2026-08-28 cs.CL 新提交 57%

Instruction Quality Matters: Refining Instructions for Effective Preference Learning

指令质量至关重要:优化指令以实现有效的偏好学习

Seohyeong Lee, Hwaran Lee, Buru Chang

机构 * Sogang University(西江大学) Korea University(高丽大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2608.26188 2026-08-28 cs.AI 新提交 79%

Is Your Neighborhood Safe? Place-based Stigma in Large Language Models' Urban Safety Judgments

你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名

Huy Nguyen, Yue Lin

机构 * Augustana College(奥古斯塔纳学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 该研究探究大型语言模型的城市安全判断是否受社区名称携带的人口刻板印象影响,发现名称会降低边缘化群体占比高的社区的安全评分,移除名称可减少偏见与准确性损失。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26860 2026-08-28 cs.LG cs.AI math.OC 新提交 62%

Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic

基于强化学习的混合交通环境下网联自动驾驶车辆(CAV)队列汇入机动控制

Biao Yin, Abderrahmane Kasmi, Nadir Farhi

机构 * Université Gustave Eiffel(古斯塔夫·埃菲尔大学) Université Paris Dauphine-PSL(巴黎多芬大学-PSL) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia机构)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对混合交通环境下CAV队列汇入的安全高效控制问题,提出结合SUMO的建模框架,评估PPO等DRL算法,发现PPO在平衡安全与效率上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26701 2026-08-28 cs.AI 新提交 57%

Accelerating Scientific Research with Gemini in the Real-World

利用Gemini加速现实世界中的科学研究

Samuel Schmidgall, Xiaokai Zhu, Marian Shaw, Lin Yang, Valentin Liévin, Jingyun Yang, Yuchen Zhuang, Tim Strother, Alex Bijamov, Min Woo Sun, Anil Palepu, Justin Chen, David Steiner, Jacqueline Shreibati, Wei-Hung Weng, Yilin Zhao, Xingjian Hu, Nicholas Zahn, Sadhya Garg, Julia Kirby, Yuxiang Gan, Jiaoli Li, Divy Thakkar, Shekoofeh Azizi, David Racz, Juraj Gottweis, Vivek Natarajan, Chenglin Wu, Tal Danino, Keran Rong, Haozhe Wang, Benoit Schillings, Yong Cheng, Quoc V. Le, Tao Tu

机构 * Google DeepMind(谷歌DeepMind) Duke University(杜克大学) Columbia University(哥伦比亚大学) Google Research(谷歌研究) Texas A&M University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27009 2026-08-28 cs.CR 新提交 50%

The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions

会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作

Yingjie Zhang, Yuanbo Xie, Kai Chen

专题命中 安全训练 :safety(abstract)

AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-08-28 cs.CV 新提交 50%

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2608.26971 2026-08-28 cs.CV cs.MM 新提交 82%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26506 2026-08-28 cs.LG cs.CL 新提交 79%

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击

Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen

机构 * RIKEN AIP(理化学研究所先进智能项目) Institute of Science Tokyo(东京科学大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。

Comments Accepted by EMNLP findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 57%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2608.27141 2026-08-28 cs.CR cs.AI 新提交 79%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

专题命中 红队测试 :safety(title,abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2608.27092 2026-08-28 cs.CR 新提交 67%

The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents

框架缺口:间接提示注入数据泄露可突破使用工具智能体的表层防御

Md Habibur Rahman, Jaeho Kim

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 该研究发现使用工具的智能体存在框架缺口,间接提示注入攻击可通过重新表述泄露内容突破表层防御,需通过目标约束或能力隔离等手段提升鲁棒性。

Comments 20 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 67%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2608.26154 2026-08-28 cs.CL cs.AI 新提交 62%

Evaluating AI Generated Summaries for Cancer Patients

评估面向癌症患者的AI生成摘要

Muhammad Aurangzeb Ahmad, Kim Shyu, Leon Oliver, Fergus Sleight, Paul Landau

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-08-28 cs.CV 新提交 50%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 2 篇

2608.26324 2026-08-28 cs.LG 新提交 79%

Privacy Without Regret: Differentially Private Inference-Time Alignment

无遗憾的隐私:差分隐私推理时对齐

Ishi Jain, Nandini Bhattad, Sayak Ray Chowdhury

机构 * Indian Institute of Technology Kanpur(坎普尔印度理工学院)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 该研究针对最佳N采样的奖励黑客攻击与偏好数据隐私问题,提出PrivBoN和PrivITP方法,实现差分隐私推理时对齐,经实验验证其性能优于原有策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27147 2026-08-28 cs.AI 新提交 57%

Thomson: Continual Learning of Frontier Models for SovereignAI

Thomson:面向主权人工智能的前沿模型持续学习

Shengzhuang Chen, Jerrod Parker, Yejin Bang, Andrew M. Bean, Nabeel Seedat, Stefan Winzeck, Daniil Glazko, Jannik Zgraggen, Fangyi Yu, Scott Arnott, Dietrich Trautmann, Luca Ciuffreda, Guglielmo Bonifazi, Davide Romano, Bradley Bell, Kirsty Fielding, Daniele Giofrè, Tom Zielund, Ipshita Chatterjee, Sneha Murthy Ghantasala, Manpreet Nanreh, John Scoville, Maciej Sakowicz, Wassim Seifeddine, Lukas Thede, Jonathan Richard Schwarz

机构 * Imperial College London(帝国理工学院) DatologyAI Lambda

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 该研究提出Thomson,通过对开放权重模型的持续学习,以低预算实现前沿模型性能,可帮助更多机构构建主权人工智能,且在多任务表现优异,几乎消除了遗忘问题。

Comments Open-weight model: this https URL (https://huggingface.co/thomsonreuters/Thomson-1.0-Small)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 14 篇

2608.26222 2026-08-28 cs.LG cs.AI cs.CR cs.SE 新提交 84%

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz:面向大语言模型安全评估的安全神经元引导模糊测试

Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

机构 * University of Bristol(布里斯托尔大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 NeuronFuzz是一种安全神经元引导的LLM安全评估白盒模糊测试框架,通过利用安全神经元激活值生成反馈,在21个模型上实现了高越狱发现率和零样本迁移能力,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26162 2026-08-28 cs.AI 新提交 79%

A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian

用于心理健康支持的安全门控多模态AI后端:Anian中的分层状态表示、保守风险融合与受控生成

Lei Wang, Xiao Wang, Lei Li

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出用于围产期心理健康支持的安全门控多模态AI后端Anian,其通过分层状态表示与保守风险融合实现安全门控,原型在多任务评估中表现优异,验证了框架内部可行性。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26195 2026-08-28 cs.SE 新提交 78%

Cost-Utility Alignment in LLM Agent Trajectories:Profiling,Attribution,Diagnosis,Adaptation,and Evaluation

大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估

Dan Liu, Jian Li

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26109 2026-08-28 cs.AI 新提交 70%

Standalone LLM and a Pre-specified Agentic Pipeline for Explaining ICU Mortality Predictions: a Feasibility Study on the eICU Demo Dataset

独立大型语言模型(LLM)与预定义智能体管道用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究

Di Zhu, Chen Xie, Haoyun Zhang, Zihan Wei, Ziwei Wang, Jiazhao Shi, Ziyu Wang, Qiyang Xie

机构 * Santa Clara University(圣克拉拉大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Wake Forest University(维克森林大学) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究基于eICU演示数据集对比独立LLM与四步智能体管道解释ICU死亡率预测,发现智能体管道在指南依据性等方面更优,但需搭配归因核查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-28 cs.CL cs.AI 新提交 62%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26137 2026-08-28 cs.CL cs.LG cs.SD 新提交 62%

Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores

可解释、经公平评估且超越单人类天花板的L2口语自动评估模型——以及为何停顿编码不改变LLM流利度评分

Eichi Uehara

机构 * Aflo Technologies Inc.(Aflo科技公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 该研究构建了可解释的特征+LLM混合L2口语评估模型,其评分超越81%的人类评分者,还证实停顿编码不影响LLM流利度评分,且通过多维度方法验证了模型的公平性与可靠性。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27127 2026-08-28 cs.AI 新提交 57%

TransMeme: A Multi-Agent Framework for Cross-Cultural Meme Transcreation

TransMeme:用于跨文化梗图再创作的多智能体框架

Jingyi Zheng, Yule Liu, Zifan Peng, Tianyi Hu, Yuemeng Zhao, Xinhu Zheng, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Aarhus University(奥胡斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究针对跨文化梗图再创作的三大核心挑战,提出多智能体框架TransMeme,经中英双向梗图再创作的人工评估与LLM评判,性能优于所有基线,为该领域未来幽默迁移研究指明方向。

Comments 10 pages, 4 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27110 2026-08-28 cs.CL 新提交 57%

DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

DocTalkBN:孟加拉语专家远程医疗对话的新型数据集

Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究针对低资源语言孟加拉语医疗对话数据稀缺问题,构建了DocTalkBN多模态数据集,含大量真实远程医疗对话数据,并设置三项下游任务进行基准测试,为医疗NLP研究提供实用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 57%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏