World Model Robustness via Surprise Recognition
通过惊喜识别提升世界模型鲁棒性
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过惊喜识别提升世界模型鲁棒性
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能
通过微调LLMs推进自然语言形式化到一阶逻辑
机构 * Osnabrück University(奥斯纳布鲁克大学) ; University of Zurich(苏黎世大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文通过微调LLMs提升自然语言到一阶逻辑的转换性能,实验显示谓词可用性显著提升模型表现,T5模型优于大解码器-only模型,并能泛化至未见逻辑论证。
Comments 15 pages, 7 tables, accepted at the International Joint Conference on Learning & Reasoning (IJCLR 2025)
Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能
机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) ; Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。
通过归纳编码进行文本标注:在定性数据分析中比较人类专家与大语言模型
机构 * Lucerne University of Applied Sciences and Arts(卢塞恩应用科学大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文比较了人类专家与大语言模型在定性数据分析中的表现,发现人类在处理复杂句子时表现优异,而LLMs在简单句子上表现更佳。
Journal ref NAACL 2025
基于语义的优化方法用于修复大语言模型:代码生成的案例研究
机构 * Monash University(墨尔本大学) ; Technical University of Munich(慕尼黑技术大学) ; Chongqing University(重庆大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。
Comments 13 pages, 6 figure, 8 tables, camera-ready version
Prompt-OT: 一种用于视觉-语言模型适应中知识保留的最优传输正则化范式
机构 * Morgan Stanley(摩根士丹利) ; Clemson University(克莱姆森大学) ; Arizona State University(亚利桑那州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Arizona(亚利桑那大学) ; University of Notre Dame(圣母大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 Prompt-OT通过最优传输正则化提升视觉-语言模型在知识保留和跨领域适应中的性能
Comments Accepted to WACV 2026
学习规则增强的大语言模型评估器
机构 * Wuhan University(武汉大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出规则增强的LLM评估器,通过规则蒸馏和强化学习提升评估器的泛化能力与一致性,适用于多种评估场景。
按计算路径扩展和引导大语言模型,使其与人脑一致
机构 * Meta AI ; Laboratoire de Neurosciences Cognitives et Computationnelles (Inserm U960)(神经认知与计算实验室) ; Ecole Normale Supérieure - PSL(巴黎高等师范学院 - PSL)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究通过分析人脑和LLM的表示对齐性,发现两者在计算顺序上一致,但受模型大小和上下文长度影响。
Journal ref Neurips Proceedings 2025 - Spotlight
IberFire -- 一个用于西班牙野火风险评估的时空数据集的详细创建
机构 * Calvo Tekniker(Calvo技术员) ; Tekniker ; EHU(埃斯库德大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 IberFire是一个高分辨率的西班牙野火风险评估时空数据集,整合了120个特征,支持机器学习和深度学习建模,促进火灾预防和土地管理策略。
随机对照试验风险偏误自动评估:一种基于GEPA训练的程序化提示框架初探
机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 GEPA通过结构化优化生成一致的提示,提升随机对照试验偏误风险评估的自动化与可重复性。
Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力
机构 * Singapore Institute of Technology(新加坡理工学院) ; Amazon GenAI(亚马逊人工智能实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。
Comments 14 pages
DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。
Comments AAAI 2026 TrustAgent Workshop
鲁棒、可观测和可进化的代理系统工程:一种经过Fairy GUI代理验证的原则性框架
机构 * Fudan University(复旦大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出了一种原则性框架,通过Fairy GUI代理验证,解决了代理系统在鲁棒性、可观测性和可进化性方面的不足,提供了可维护和可扩展的代理AI系统设计方法。
Comments 50 pages, 14 figures
多粒度评估用于脑视觉解码
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。
Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC
Asm2SrcEval: 评估大型语言模型在汇编到源代码翻译中的性能
机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) ; University of New Brunswick(新不伦瑞克大学) ; Faculty of Computer Science(计算机科学学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出Asm2SrcEval基准,评估五种先进大语言模型在汇编到源代码翻译任务中的性能,揭示模型在文本相似性、流畅性和效率上的权衡,为程序翻译的准确性和效率研究提供基础。
面向移动机器人的社会感知导航:深度强化学习方法的综述
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文综述了深度强化学习在社会感知导航中的应用,分析了关键技术和挑战,提出未来需结合多种方法并建立平衡的评估标准。
增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成
专题命中 安全评测 :alignment(abstract)
AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。
通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全评测 :alignment(abstract)
AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感
PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准
专题命中 安全评测 :trustworthy(abstract)
AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。
Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn
通过对齐2D骨骼序列和多模态融合进行学习
机构 * Retrocausal, Inc.(Retrocausal公司)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出通过2D骨骼热图和多模态融合提升时间视频对齐的自监督学习方法,实现更高的准确性和鲁棒性。
Comments Accepted to ECCV 2024
探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究
专题命中 安全评测 :alignment(abstract)
AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。
Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages
分位数奖励策略优化:与点估计回归和精确分区函数对齐
机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)
专题命中 AI治理与伦理 :alignment(title);DPO(abstract);分类 cs.LG
AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。
Comments 58 pages, NeurIPS2025 camera-ready version
LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜
机构 * NVIDIA Research(NVIDIA研究)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。
Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard
关于用户界面在AI代理治理中的调节潜力
机构 * University of Washington(华盛顿大学) ; KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY
AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。
Comments RegML workshop at NeurIPS 2025 (oral)
谁的人设?LLM研究中的人设实验及透明化路径
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨了LLM研究中合成人设实验的代表性与生态效度问题,提出透明化检查表以提升评估的严谨性和实证性。
Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling
Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, 343-354
M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。
Comments 12 pages, 6 figures
平衡效率与公平:多无人机协作路径规划的迭代交换框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) ; College of Computer Science and Engineering, Chongqing Three Gorges University(重庆三峡大学计算机科学与工程学院) ; Chinese Academy of Sciences, New Territories, Hong Kong(中国科学院香港新 Territories 分院) ; City University of Hong Kong, Kowloon, Hong Kong(香港城市大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文提出一种迭代交换框架,用于多无人机协作路径规划,通过任务交换和路径细化平衡效率与公平性,实验表明其在总距离和makespan之间取得更优权衡。
迈向电力电子中的伦理AI:工程实践和角色必须如何适应
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文探讨电力电子中AI伦理的重要性,提出四个核心伦理支柱,并呼吁工程师和IEEE推动伦理标准与人才发展。
面向语义感知车联网的自适应接入方案:公平性与信息年龄优化的联合优化
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文提出一种面向语义感知车联网的自适应接入方案,通过联合优化公平性与信息年龄,利用顺序凸近似和大语言模型算法提升通信效率与安全性。
Comments This paper has been submitted to IEEE transactions on moblie computing
用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。
Comments 9 pages