daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
daVinci-Agency: 解锁长周期代理数据高效性
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
daVinci-Agency: 解锁长周期代理数据高效性
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。
具有大语言模型的混合多智能体框架的认知多样性多项选择题生成
机构 * Arizona State University(亚利桑那州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 ReQUESTA通过混合多智能体框架生成认知多样化的多项选择题,提升生成的题目难度、区分度和语义一致性。
Comments This manuscript is under review at Electronics
平等接入,不平等互动:对大语言模型公平性的反事实审计
机构 * Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡大学) ; Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth分校) ; Independent Researcher in AI and Statistics(人工智能与统计学独立研究者) ; Hardware Technology Organization(硬件技术组织)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文通过反事实提示设计,评估了GPT-4和LLaMA在不同人口身份下的互动质量差异,发现即使接入平等,模型在互动质量上仍存在系统性差异。
Comments 13 pages, 1 figure
评估CAN入侵检测系统中的误报和遗漏攻击
机构 * Department of Applied Mathematics University of Colorado Boulder(应用数学系科罗拉多大学波德摩尔分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文通过评估CAN IDS在对抗性攻击下的性能,揭示了其在误报和遗漏攻击方面的脆弱性,强调了对抗鲁棒性在安全关键汽车系统中的重要性。
Comments 8 pages, 2 figures, and 8 tables
RobustExplain: 评估基于LLM的推荐解释代理的鲁棒性
机构 * Workday
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 RobustExplain提出首个评估框架,用于衡量LLM生成推荐解释的鲁棒性,揭示当前模型鲁棒性较低,较大模型稳定性更高。
Comments 8 pages, 4 figures
Drift-Bench: 通过多轮交互诊断LLM代理在输入故障下的合作破裂
机构 * University of Notre Dame(内布拉斯加大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 Drift-Bench通过多轮交互评估LLM代理在输入故障下的合作破裂,采用角色驱动的用户模拟器和Rise评估协议,揭示澄清效果随用户角色和故障类型的变化,推动代理安全评估。
Comments 65 pages, 40 figures
T-LLM:通过时间蒸馏教大语言模型进行时间序列预测
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 T-LLM通过时间蒸馏框架,使通用大语言模型具备时间序列预测能力,实验显示其在多种设置下均优于现有方法。
AgroFlux:农业生态系统碳和氮通量预测的空间-时间基准
机构 * University of Pittsburgh(匹兹堡大学) ; University of Minnesota - Twin Cities(明尼苏达大学-双城分校) ; Colorado State University(科罗拉多州立大学) ; University of Maryland(马里兰大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 AgroFlux 提出一个空间-时间基准数据集,整合物理模型与现实观测,评估深度学习模型在农业生态系统碳氮通量预测中的性能。
通过经济游戏 eliciting 大语言模型的信任度先验
机构 * University of Hong Kong(香港大学) ; The University of Hong Kong(香港大学) ; Peking University(北京大学) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) ; Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康重点实验室) ; IDG/McGovern Institute for Brain Research, Peking University(北京大学脑科学研究院) ; Peking-Tsinghua Center for Life Sciences, Peking University(北京大学-清华大学生命科学中心) ; Key Laboratory of Machine Perception, Ministry of Education, China(教育部机器感知重点实验室)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 通过经济游戏实验,研究如何通过行为博弈论中的信任游戏获取大语言模型的信任度先验,并揭示其与人类信任差异及刻板印象模型的关系。
对比域泛化用于质谱中跨仪器分子识别
机构 * School of Electrical Engineering, Korea University, Seoul 02841, Korea(韩国大学电气工程学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种跨模态对齐框架,通过将质谱直接映射到预训练化学语言模型的分子结构嵌入空间,提升跨仪器分子识别的泛化能力。
Comments 8 pages, 2 figures
学习可解性的边界:对齐大语言模型以检测不可解的问题
机构 * LARG, Research Center for Social Computing and Interactive Robotics, HIT(LARG,社会计算与交互机器人研究中心,哈尔滨工业大学) ; School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) ; iFLYTEK
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出UnsolvableQA数据集和UnsolvableRL框架,通过逆向构建引入逻辑矛盾,提升LLM对不可解问题的检测能力,并在Qwen3-4B-Instruct上提升可解推理准确率至69.4%。
Comments preprint
BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统
机构 * TU Munich(慕尼黑技术大学) ; MIT(麻省理工学院) ; Intel Labs(英特尔实验室) ; AWS AI Labs(亚马逊AI实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。
Comments CIDR'26
端到端代理RAG系统训练用于可追溯的诊断推理
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。
HueManity: 探索 MLLMs 中的细粒度视觉感知
机构 * Google(谷歌) ; Waymo
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。
Journal ref ICML 2025 Workshop on Assessing World Models
巴西葡萄牙语图像描述生成:跨原生翻译数据集研究
机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) ; École de Technologie Supérieure (ÉTS)(加拿大超技术学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。
Comments Accepted to JBCS. 18 pages, 11 figures
将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。
Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models
链式提示法提升系统综述搜索策略
机构 * Electrical and Computer Engineering(电气与计算机工程系) ; American University of Beirut(贝鲁特美国大学) ; Department of Internal Medicine(内科系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于LLM的链式提示框架,用于自动化生成系统综述的高召回率搜索策略,通过分解目标、提取PICO要素等方法提升检索效果。
Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)
工程仿真中几何准备和网格生成的AI方法综述
机构 * Sandia National Laboratories(桑迪亚国家实验室) ; Old Dominion University(旧 Dominion 大学) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; New York University / Stony Brook University(纽约大学 / 斯通布鲁克大学) ; CEA(法国原子能委员会) ; Dalian University of Technology(大连理工大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了AI在工程仿真中用于几何准备和网格生成的方法,涵盖分类分割、质量预测、去特征化及自动化生成技术,强调AI与传统算法的互补作用。
Comments 47 pages, 0 figure, accepted by the International Meshing Roundtable conference 2026
超越抽象合规:将人工智能中的信任视为一种道德关系
机构 * Boehringer Ingelheim Pharma GmbH \& Co. KG Birkendorfer Str. 65 Biberach an der Riss Germany 88400 ; Carnegie Mellon University Pittsburgh, PA USA ; Rhodes University Makhanda South Africa ; International University of Management Namibia ; Charles Darwin University Australia ; Boehringer Ingelheim Pharma GmbH \& Co. KG ; Carnegie Mellon University ; Rhodes University ; International University of Management ; Charles Darwin University
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于非洲关系伦理的信任原则,通过医疗和教育案例,探讨如何将AI信任视为动态关系,促进公平和情境敏感的AI系统。
OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集
机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) ; Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。
Comments 5 pages, 1 figure, 1 table, 1 code snippet
知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任
机构 * National University of Singapore(国立新加坡大学) ; Singapore University of Technology(新加坡科技学院) ; Nanyang Technological University(南洋理工大学) ; Duke University(杜克大学) ; University of Waterloo(滑铁卢大学) ; Microsoft(微软公司) ; Peking University(北京大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。
Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning
推理模型能增强嵌入模型吗?
机构 * CSE, HKUST(香港科技大学计算机科学与工程系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。
Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts
弥合算术鸿沟:认知复杂性基准与金融-PoT用于稳健的金融推理
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出认知复杂性基准和金融-PoT框架,通过架构解耦提升金融推理的鲁棒性,使Qwen3-235B模型在复杂任务中的准确率显著提高。
UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。
噪声但有效:通过不完美的裁判者对LLM进行稳健的统计评估
机构 * Queen’s University Belfast(女王大学贝尔法斯特分校) ; University College London(伦敦大学学院) ; Google DeepMind(谷歌DeepMind)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种稳健的LLM统计评估框架,通过建模不完美裁判行为,理论保证有限样本的一类错误控制,并验证了在不完美裁判设定下的评估有效性。
Comments Accepted to ICLR2026
神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当
机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; Jam Technologies GmbH ; University of Mannheim(曼海姆大学) ; GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 SQuID通过神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当,具有成本低、可扩展性强的优势。
基于情感和语义的对话手势合成系统
机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。
SETA:复合人工智能系统的统计故障归因
机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 SETA提出了一种模块化鲁棒性测试框架,用于分析复合人工智能系统的故障归因,通过组件级分析和错误传播推理,实现细粒度的鲁棒性评估。
Comments Accepted to CAIN 2026 co-hosted with ICSE 2026
Health-SCORE: 向提升健康大语言模型的可扩展评分标准迈进
机构 * Optum AI
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 Health-SCORE是一种通用且可扩展的基于评分标准的训练和评估框架,通过降低开发成本和提升响应质量,使医疗领域的大语言模型评估和训练更加可行。
HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架
机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) ; Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) ; Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) ; China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。
Comments 13 pages, 8 figures