arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2605.22487 2026-07-03 cs.CL 版本更新 57%

Polite on the Surface, Broken in Practice: A Curated Dataset for Fixing Generation and Register Failures in Low-Resource Bangla Text Generation

表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集

Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi

机构 * United International University(国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03178 2026-07-03 cs.LG cs.RO 57%

RADE: Learning Risk-Adjustable Driving Environment via Multi-Agent Conditional Diffusion

RADE:通过多智能体条件扩散学习风险可调整的驾驶环境

Jiawei Wang, Xintao Yan, Yao Mu, Haowei Sun, Zhong Cao, Henry X. Liu

机构 * Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) University of Michigan Transportation Research Institute(密歇根大学交通研究研究院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 RADE通过多智能体条件扩散模型生成真实且可控风险的驾驶场景,直接从数据学习风险条件行为,提升自动驾驶安全评估的现实性和可扩展性。

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 57%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 57%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 57%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 57%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31478 2026-07-01 cs.AI cs.CV 新提交 57%

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

一次反思不够:通过多假设失败归因进行自我修正的自主研究

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Hello Inc.(Hello公司) Xiaohongshu Inc.(小红书公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出SAGE框架,通过多假设失败归因(MHFA)机制将实验失败恢复转化为结构化因果诊断,显著提升自主研究代理的可靠性和产出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 57%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 57%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 57%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 57%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 57%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24392 2026-07-01 cs.AI 新提交 57%

ATRIA: Adaptive Traceable ECG Reporting with Iterative Agents

ATRIA: 自适应可追溯心电图报告与迭代智能体

Donggyun Hong, Kyuhwan Lee, Junmyung Kwon, Yong-Yeon Jo

机构 * MedicalAI Co., Ltd.(MedicalAI有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出多智能体系统ATRIA,模拟临床医生迭代工作流,实现可追溯、可编辑的心电图报告生成,支持证据绑定和中间修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16783 2026-07-01 cs.CL 57%

SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs

SubData:连接异构数据集以实现对LLM政治和人口视角的理论驱动评估

Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) GESIS - Leibniz Institute for the Social Sciences(GESIS - 莱布尼茨社会科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SubData框架,通过标准化异构数据集评估LLM视角对齐,并展示如何利用该工具测试不同对齐LLM对特定人口群体内容的分类差异。

Comments 14 pages, 2 figures, 3 tables

Journal ref Proceedings of the 5th Workshop on Perspectivist Approaches to NLP (NLPerspectives) at the 15th Language Resources and Evaluation Conference (LREC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30531 2026-06-30 cs.AI 57%

Entity Binding Failures in Tool-Augmented Agents

工具增强型代理中的实体绑定失败

Rahul Suresh Babu, Shashank Indukuri

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究工具增强型语言模型代理中实体绑定失败问题,提出实体感知执行机制,实验表明该方法可消除错误实体操作但可能降低任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30383 2026-06-30 cs.AI 57%

Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents

你的智能体站在哪一边?LLM智能体中的多方委托人忠诚度

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学皮尼AI学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究LLM智能体在多方对话中对委托人的忠诚度问题,提出基准测试PrincipalBench和两种机制(提示忠诚度框架和知识蒸馏),揭示泄漏与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30175 2026-06-30 cs.CL 57%

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph

CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织

Chengtao Gan, Xiaoke Guo, Yushan Zhu, Zhaoyan Gong, Zhiqiang Liu, Songze Li, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) JIUTIAN Research(JIUTIAN研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29887 2026-06-30 cs.AI 57%

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

SafePyramid: 一种用于上下文策略护栏的分层基准

Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出SafePyramid基准,包含1000轮多领域对话和3000条应用特定策略,通过三级难度评估LLM在上下文中执行策略护栏的能力,发现当前模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29746 2026-06-30 cs.AI cs.HC 57%

DEEPMED Search: An Open-Source Agentic Platform for Medical Deep Research with Introspective Verification

DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台

Maolin Liu, Fanyu Xu, Ruoqing Xu, Jiahang Zhang, Hao Wang, Rui Wang

机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。

Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29700 2026-06-30 cs.AI 57%

Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

面向具有规划器反馈的大型语言模型的安全可靠PDDL形式化

Jiamei Jiang, Jiajing Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Industry-education Integration, University of Chinese Academy of Sciences(中国科学院大学产教融合学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出NL-PDDL-Bench基准和规划器在环框架,通过验证器诊断和偏好优化提升LLM生成PDDL规范的可执行性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 57%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29493 2026-06-30 cs.AI 57%

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

我们形式化基准测试中的缺陷:Lean定理证明中的数据集缺陷与评估失败

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 通过大规模静态检查器审计五个Lean定理证明基准,发现398个机械可验证问题(如反例、空洞定理),并提出缺陷分类、自动检查工具和评估标准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29390 2026-06-30 cs.CY 57%

Toward Comprehensive Risk Assessments and Assurance of AI-Based Systems

迈向基于AI系统的全面风险评估与保证

Heidy Khlaaf

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对AI系统部署带来的新风险,本文提出一个整合运行设计域(ODD)的端到端AI风险框架,以统一术语、改进风险评估,确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28856 2026-06-30 q-bio.OT cs.AI 57%

Building AI-Ready Data Systems for Space Life Sciences, Aerospace Medicine, and Deep Space Exploration

构建面向空间生命科学、航空航天医学和深空探测的AI就绪数据系统

Sylvain V. Costes, Sergio Garcia Busto, Ryan T. Scott, James A. Casaletto, Gautier Bardi de Fourtou, Brian M. Evarts, Amanda M. Saravia-Butler, Xavier-Lewis Palmer, Rodrigo Coutinho de Almeida, Laetitia Frost, Jelena Tešić, Afshin Beheshti, Christopher E. Mason, Peter W. Rose, Sergio E. Baranzini, Lauren M. Sanders, Stefania Giacomello, Pedro Madrigal

机构 * Blue Marble Space Computational and Systems Biology(计算与系统生物学) Trivedi Institute for Space and Global Biomedicine(Trivedi空间与全球医学研究所) Wellcome Sanger Institute(Wellcome桑格研究所) University of Cambridge(剑桥大学) Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学 division, NASA Ames研究中心) Massachusetts Institute of Technology(麻省理工学院) Crown Point Technologies, Inc(Crown Point Technologies公司) BiosView Labs Directorate of Human and Robotic Exploration, European Space Agency(欧洲航天局人类和机器人探索部门) Texas State University(德克萨斯州立大学) McGowan Institute for Regenerative Medicine, Department of Surgery, University of Pittsburgh School of Medicine(McGowan再生医学研究所,匹兹堡大学医学院外科系) Center for Space Biomedicine, Trivedi Institute for Space and Global Biomedicine(空间生物医学中心,Trivedi空间与全球医学研究所) Department of Bioengineering, University of Pittsburgh(匹兹堡大学生物工程系) Stanley Center for Psychiatric Research, Broad Institute of MIT and Harvard(Stanley精神医学研究中心,MIT和哈佛Broad研究所) Department of Systems and Computational Biomedicine and WorldQuant Initiative, Weill Cornell Medicine(系统与计算生物医学系及WorldQuant计划,Weill Cornell医学院) San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,加州大学旧金山分校神经病学系) Science for Life Laboratory, Department of Gene Technology, KTH Royal Institute of Technology(Science for Life实验室,基因技术系,皇家理工学院) European Molecular Biology Laboratory, European Bioinformatics Institute (EMBL-EBI)(欧洲分子生物学实验室,欧洲生物信息研究所(EMBL-EBI))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对空间生物学数据异构性阻碍AI应用的问题,提出从FAIR到AI就绪再到空间就绪的三层数据架构,并建议建立国际协调机构以支持深空生物学研究。

Comments 26 pages, 3 figures, 1 table, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28383 2026-06-30 cs.CV cs.LG 57%

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

零标签驾驶场景复杂度检测基于联合嵌入预测架构

Santosh Jaiswal

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28365 2026-06-30 cs.IR cs.AI 57%

CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval

CAMI:成本感知的智能体引导多索引语义检索

Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

机构 * IBM Software Innovation Lab India(IBM软件创新实验室印度)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出CAMI框架,将多索引构建形式化为预算约束的多目标组合选择问题,通过智能体发现、原子单元搜索和置信度感知调度,在严格预算下系统性地识别高召回率索引组合,相比标准基线召回率提升9.4%,预算减少5倍。

Comments Accepted to ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09785 2026-06-30 cs.CL 57%

EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpreting

EPIC-EuroParl-UdS:翻译与解读的信息论视角

Maria Kunilovskaya, Christina Pollkläsener

机构 * Saarland University(萨尔兰大学) University of Hildesheim(希尔德斯海姆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文介绍了更新和结合的双向英语-德语EPIC-UdS(口语)和EuroParl-UdS(书面)语料库,包含原始欧洲议会演讲及其翻译和解读。新版本修正了元数据和文本错误,优化内容,更新语言标注,并增加词对齐和词级意外指数等新层。

Comments 16 pages with appendices, 8 figures to be published in LREC-2026 main conference proceedings

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 6998--7013, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20610 2026-06-30 cs.SE cs.CL 57%

SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference

SpecMind:基于认知的、交互式多轮框架用于后置条件推断

Cuong Chi Le, Minh V. T Pham, Tung Vu Duy, Cuong Duc Van, Huy N. Phan, Hoang N. Phan, Tien N. Nguyen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) FPT Software AI Center(FPT软件AI中心) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SpecMind通过多轮交互式提示方法提升后置条件生成的准确性和完整性,利用反馈驱动模型迭代优化,增强代码理解和程序行为对齐。

Comments Accepted in ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06359 2026-06-30 cs.AI cs.MA 57%

Modelling Human Values for Value-Aware Multi-Agent Systems

为价值感知多智能体系统建模人类价值观

Nardine Osman, Mark d'Inverno

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个形式化框架,用于表示人类价值观,以支持多智能体系统中的价值感知推理。通过社会心理学研究,建立价值关系和重要性模型,实现行为评估和价值感知决策机制。

Comments arXiv admin note: text overlap with arXiv:2305.02748

详情

展开后加载摘要…

URL PDF HTML 收藏