arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2604.27415 2026-05-01 cs.LG 57%

ChipLingo: A Systematic Training Framework for Large Language Models in EDA

ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架

Lei Li, Xingwen Yu, Jianguo Ni, Junxuan Zhu, Jieqiong Zhang, Jian Zhao, Zhi Liu

机构 * Ickylin AI Team(Ickylin AI团队)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 57%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 57%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 57%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL 57%

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21214 2026-04-29 cs.DB cs.AI 57%

A Demonstration of SQLyzr: A Platform for Fine-Grained Text-to-SQL Evaluation and Analysis

SQLyzr平台:一种细粒度文本到SQL评估与分析的演示

Sepideh Abedini, M. Tamer Özsu

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文介绍SQLyzr平台,通过细粒度评估和分析改进文本到SQL模型,提供多种指标和真实场景下的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 57%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 57%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24525 2026-04-28 cs.SE cs.AI 57%

Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

理解自动化代码审查机器人在实践中评估的极限

Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar, Eray Tüzün

机构 * Bilkent University(比尔肯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了在工业环境中自动化评估LLM驱动的代码审查机器人评论的可行性及限制,发现不同模型和评估方法在与人类标签的一致性上表现不一,揭示了静态 artifacts 难以捕捉上下文约束和优先级决策的挑战。

Comments The first two authors contributed equally. Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24429 2026-04-28 cs.CL 57%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07538 2026-04-28 cs.CL 57%

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents

SwissGov-RSD: 一个人工标注的、跨语言基准,用于识别相关文档之间的词级语义差异

Michelle Wastl, Jannis Vamvas, Rico Sennrich

机构 * Department of Computational Linguistics, University of Zurich(瑞士苏黎世大学计算语言学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SwissGov-RSD,首个跨语言文档级语义差异识别基准,包含224个多语言文档,通过人工标注词级差异,评估多种模型表现,揭示自动方法在跨语言任务中的不足。

Comments 30 pages; v3 accepted to ACL Main (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13650 2026-04-28 cs.CL 57%

CRISP: Persistent Concept Unlearning via Sparse Autoencoders

CRISP:通过稀疏自编码器实现持久性概念卸载

Tomer Ashuach, Dana Arad, Aaron Mueller, Martin Tutek, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术ion-以色列理工学院) Boston University(波士顿大学) University of Zagreb, FER(Zagreb大学,FER) Kempner Institute, Harvard University(哈佛大学 Kempner研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CRISP利用稀疏自编码器实现持久性概念卸载,通过自动识别多层显著SAE特征并抑制其激活,优于现有方法,在WMDP基准的安全关键卸载任务中有效移除有害知识并保持通用能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23474 2026-04-28 cs.LG 57%

GeoCert: Certified Geometric AI for Reliable Forecasting

GeoCert: 用于可靠预测的几何AI

Regina Zhang, Zongru Li, Honggang Wen, Xiaofeng Liu, Siu-Ming Yiu, Pietro Liò, Kwok-Yan Lam

机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 GeoCert通过统一预测、物理推理和形式验证,提升预测系统的准确性与可靠性,实现97.5%的计算成本降低和更高效的认证。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23257 2026-04-28 cs.SE cs.AI 57%

Knowledge Lever Risk Management for Software Engineering: A Stochastic Framework for Mitigating Knowledge Loss

软件工程中的知识杠杆风险管理:一种缓解知识损失的随机框架

Mark Chua, Samuel Ajila

机构 * Department of Systems and Computer Engineering(系统与计算机工程系) Carleton University(卡尔顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出知识杠杆风险管理框架,通过将无形知识资产转化为风险缓解机制,结合四个阶段架构和随机模型,提升软件开发项目中的知识资本和项目成功率。

Comments A shorter version of the paper will be presented on the 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications (SERA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23079 2026-04-28 cs.CV cs.AI 57%

From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models

从像素到解释:结合CNN-Transformer集成、视觉可解释性和视觉语言模型的可解释性糖尿病视网膜病变分级

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildirim Yayilgan, Sarang Shaikh

机构 * Department of Informatics, University of Salerno(萨勒诺大学信息学院) Department of Information Security and Communication Technology (IIK), Norwegian University of Science and Technology(挪威科技大学信息安全部)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合强判别模型与多模态解释的方法,利用APTOS 2019基准评估六种CNN和Transformer模型,通过集成策略提升分级一致性,并利用视觉语言模型生成可解释的视网膜病变分级结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22897 2026-04-28 cs.IR cs.AI 57%

Citation-Driven Multi-View Training for Patent Embeddings: QaECTER and Sophia-Bench

基于引用驱动的多视图训练的专利嵌入:QaECTER和Sophia-Bench

Younes Djemmal, You Zuo, Kim Gerdes, Kirian Guiller

机构 * AI Lab, Questel(Questel人工智能实验室) Qatent(Qatent公司) Inria(法国国家信息与自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Sophia-Bench专利检索基准和QaECTER模型,通过多视图对齐和引用增强指标,提升模型在不同查询类型、技术领域和司法管辖区的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 57%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15993 2026-04-28 cs.CL 57%

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

解释自然语言中的谜题解决方案:对6x6数独的探索性研究

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究评估了五种LLM在解决和解释6x6数独中的表现,发现尽管部分模型能解决谜题,但无法提供反映战略推理或直观问题解决的解释,凸显了LLM在人机协作决策中需解决的关键挑战。

Comments Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 57%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18919 2026-04-27 cs.CL 57%

Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data

提出用于分析与外部结果关联的主题模型和评估框架:以利用大规模企业评论数据的领导力分析为例

Yura Yoshida, Masato Kanai, Masataka Nakayama, Haruki Ohsawa, Yukiko Uchida, Arata Yuminaga, Gakuse Hoshina, Nobuo Sayama

机构 * Accenture Japan Ltd(安永日本有限公司) Kyoto University Institute for the Future of Human Society(京都大学未来人类社会研究所) OpenWork Inc.(OpenWork公司) Integral Corporation(Integral公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种利用大语言模型生成主题的方法,结合定制评估框架,提升主题可解释性、特定性和极性一致性,通过日本主要企业评论平台OpenWork的员工评论数据验证,提升了对员工士气等外部结果的解释力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 57%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 57%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09926 2026-04-24 cs.LG 57%

PROPER Agents: Proactivity Driven Personalized Agents for Advancing Knowledge Gap Navigation

PROPER代理:基于主动性的个性化代理以推进知识缺口导航

Kirandeep Kaur, Vinayak Gupta, Aditya Gupta, Chirag Shah

机构 * University of Washington(华盛顿大学) Chan Zuckerberg Biohub(查纳·楚克生物枢纽)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出PROPER框架,通过显式建模用户特定的知识缺口,改进主动帮助系统,提升任务完成质量与效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 57%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20441 2026-04-23 cs.AI 57%

MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

MedSkillAudit:一种面向医学研究代理技能的领域特定审计框架

Yingyong Hou, Xinyuan Lao, Huimei Wang, Qianyu Yao, Wei Chen, Bocheng Huang, Fei Sun, Yuxian Lv, Weiqi Lei, Xueqian Wen, Pengfei Xia, Zhujun Tan, Shengyang Xie

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出MedSkillAudit框架,用于评估医学研究代理技能的可靠性,通过专家评审和统计指标验证其有效性,为医学研究代理技能的治理提供实践基础。

Comments 20 pages, 9 figures, 1 graphic abstract, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-04-23 cs.CL 57%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19998 2026-04-23 cs.AI 57%

What Makes a Good AI Review? Concern-Level Diagnostics for AI Peer Review

什么使一个好的AI评审?针对AI同行评审的关切层面诊断

Ming Jin

机构 * Bradley Department of Electrical & Computer Engineering(布拉德利电气与计算机工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出关切对齐框架,通过关切层面分析评估AI评审质量,发现校准常是关键约束,而非单纯检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19815 2026-04-23 cs.AI 57%

Large Language Models Meet Biomedical Knowledge Graphs for Mechanistically Grounded Therapeutic Prioritization

大型语言模型与生物医学知识图谱结合用于机制性指导的治疗优先级排序

Chih-Hsuan Wei, Chi-Ping Day, Zhizheng Wang, Christine C. Alewine, Betty Tyler, Hasan Slika, David Saraf, Chin-Hsien Tai, Joey Chan, Robert Leaman, Zhiyong Lu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出DrugKLM框架,结合生物医学知识图谱与大语言模型的机制推理,提升治疗优先级排序的准确性与生物学依据。

Comments 24 pages, 5 figures in main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19502 2026-04-23 cs.CL 57%

Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews

超越评分:AI评论的全面评估与基准

Bowen Li, Haochen Ma, Yuxin Wang, Jie Yang, Yining Zheng, Xinchi Chen, Xuanjing Huang, Xipeng Qiu

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Beyond Rating框架,通过五个维度评估AI评论,引入Max-Recall策略和高质量数据集,证明文本中心指标与评分准确性的强相关性。

Comments 38 pages,8 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10960 2026-04-23 cs.AI 57%

RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval Generation

RAG-KT: 跨平台可解释知识追踪的多视图融合检索生成

Zhiyi Duan, Hongyu Yuan, Rui Liu

机构 * Inner Mongolia University(内蒙古大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 RAG-KT通过多视图融合检索生成技术,解决传统知识追踪模型在跨平台迁移和解释性上的不足,提升准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏