In-game Toxic Detection: Bi-directional Representations with Attention Residuals
游戏内毒性检测:带注意力残差的双向表示
机构 * University of Sydney(悉尼大学)
AI总结 针对游戏内毒性检测中短文本与俚语挑战,提出带注意力残差的双向表示模型BRAR,在槽填充任务上优于基线。
Comments Accepted by AAAI 2023
期刊&会议
AAAI Conference on Artificial Intelligence · 会议 · Artificial Intelligence
游戏内毒性检测:带注意力残差的双向表示
机构 * University of Sydney(悉尼大学)
AI总结 针对游戏内毒性检测中短文本与俚语挑战,提出带注意力残差的双向表示模型BRAR,在槽填充任务上优于基线。
Comments Accepted by AAAI 2023
ReproBench:基准测试LLM智能体从零开始复现漏洞
AI总结 本文提出ReproBench基准,从CVE标识符出发评估LLM智能体端到端漏洞复现能力,发现仅5.3%成功,但证实了自主复现的潜力,并识别了关键瓶颈。
Comments 15 pages (9 pages main text + 6 pages appendix), 5 figures, 11 tables. Submitted to AAAI 2027
CUE-Mem:通过多模态对话中的隐式线索对长期用户记忆进行基准测试
AI总结 CUE-Mem是一个多模态基准,通过隐式线索评估长期用户记忆,包含2674个问题和四个任务,发现保留细微线索是主要瓶颈,并测试了文本化与原生多模态访问的效果。
Comments 28 pages. Submitted to AAAI 2027. Code: https://github.com/yulinlp/CUE-MEM. Data: https://huggingface.co/datasets/Kkryptonite/CUE-Mem
单步即最优:无条件整流流是 Noise2Noise 去噪器,多步积分确有损害——低剂量 CT 上的基准与基于任务的检测性研究
AI总结 本研究证明在无标签去噪中,无条件整流流的一步读出即达 MMSE 最优,多步积分反而降低保真度;通过低剂量 CT 基准 CTDenoiser 验证,并揭示 PSNR 提升掩盖了临床检测能力的下降。
Comments 16 pages, 3 figures, submitted to AAAI
基于原型网络的正式归纳性隐式解释
AI总结 本文提出基于原型网络的正式归纳性隐式解释方法,通过形式化方法提升模型可解释性,适用于图像分类任务。
Comments Accepted at AAAI-26
物理智能体的安全技能退役
机构 * Imperial College London(伦敦帝国理工学院)
AI总结 针对物理智能体技能退役,提出匹配权限反事实与双门退役证书,实验显示任务基准可移除94%条款但产生未授权效应,需审计权限契约。
Comments Submitted to the Special Track on AI Alignment of the Forty-First AAAI Conference on Artificial Intelligence (AAAI-27); currently under review
Motif-Vocab:面向基因组语言模型的统计校准转录因子身份分词器
AI总结 针对基因组语言模型分词缺乏调控先验的问题,提出Motif-Vocab,通过统计校准基序匹配生成TF身份令牌,在多数下游任务上优于随机对照,提供可解释的归纳偏置。
Comments 9 pages, 4 figures, submitted to the Forty-First AAAI Conference on Artificial Intelligence (AAAI-27)
行为不足:基于机制的LLM社会中社会规范涌现评估
AI总结 本研究提出基于期望测量的评估框架,揭示LLM社会中合作涌现可由不同机制驱动,为多智能体系统设计提供原则性依据。
Comments Under review at AAAI 2027 Special Track: AI Alignment
CricRAG:用于个性化板球教练的检索增强视觉语言模型
AI总结 CricRAG通过检索相似但更优的技术作为参考,使视觉语言模型提供符合技能水平的个性化板球教练反馈,实现了94%的专业评估一致性。
Comments AAAI 25 - Towards Knowledgeable Foundational Models workshop
开放科学,封闭模型:资金如何塑造科学中的人工智能
AI总结 本研究分析104,226篇论文,发现资金来源影响科学中基础模型的参与方式:公共资金促进开放权重模型使用,行业云积分和合作偏向封闭模型,且全球南方研究被边缘化。
Comments Accepted to AAAI/ACM Conference on AI, Ethics and Society (AIES) 2026
并非所有秩都平等:跨任务预算感知的LoRA合并
机构 * Samsung Research America(三星美国研究院)
AI总结 针对LoRA合并中均匀秩预算假设导致的性能损失,提出无数据净效用指标,通过SVD分解和全局评分选择奇异方向,在视觉和语言任务上分别提升2.1%和2.2%。
Comments 7 pages, AAAI submission
从潜在生物标志物到临床规则:基于嵌入引导的规则挖掘与基于归因的翻译用于可解释表格学习
AI总结 提出一种四步流水线,在FT-Transformer潜在空间挖掘规则并翻译为临床特征,在六个数据集上多数优于原始特征规则,但高性能潜在规则翻译后可能性能下降。
Comments 12 pages, submitted to AAAI 2027
大型语言模型是好的金融用户模拟器吗?一项初步研究
机构 * Hithink Research(恒生研究院) ; Nanyang Technological University(南洋理工大学) ; McMaster University(麦克马斯特大学)
AI总结 本研究通过120名志愿者的模拟交易实验,初步评估了大型语言模型作为金融用户模拟器的能力,发现市场信息可提升操作与股票预测,但交易规模预测困难,且存在行为压缩现象。
Comments The complete version will be open and the paper is under review in AAAI
“总想用它做所有事”:理解年轻人对AI依赖的看法
AI总结 本研究通过问卷收集18-25岁AI聊天机器人用户反馈,确定AI依赖的三个促成因素,指出其对年轻人的心理与发展影响,并提出相关启示。
Comments To appear in proceedings of the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES '26)
感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐
AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。
Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally
量化对生物医学大语言模型可靠性的影响
AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。
Comments 8 pages, 1 figure. Accepted at the AAAI 2026 Fall Symposium Series (AT-AI4H-NW 2026)
PADiff: 预测性与自适应扩散策略用于即兴团队合作
AI总结 PADiff通过整合队友预测信息,提升在非平稳即兴团队合作场景中的预测与适应能力,实现多模态协作模式的多样化。
Comments Accepted by AAAI 2026
当人工智能进入职场,谁面临更大风险?一项性别化分析
AI总结 本研究基于新数据集分析AI暴露在男性和女性主导职业中的差异,发现女性主导职业暴露更均匀且LLM相关暴露更高,低技能低薪女性面临更大风险。
Comments 12 pages, 5 figures, 8 tables. Accepted at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
开源权重大语言模型在招聘应用中引发性别与种族偏见的语言触发因素
机构 * Recruit Co., Ltd.(瑞可利有限公司)
AI总结 本研究首次系统审计六个开源权重LLM,发现招聘语言中的代理型与编码排斥词汇分别抑制女性和非白人候选人评分,并提出部署前审计协议以应对欧盟AI法案合规风险。
Comments Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026). Extended version with Appendices A-B (prompt templates and full stimulus set)
从基列之河到大语言模型的推理分布:大规模隐性方言偏见与语言画像
机构 * Faculty of Computer Science, Dalhousie University(达尔豪斯大学计算机科学学院)
AI总结 本研究通过匹配伪装范式探测十个大语言模型,发现其推理分布中沿种族与声望维度存在隐性方言偏见,且各变体受不同刻板印象簇影响。
Comments 12 pages, 5 figures. Accepted to the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
CoMem:进化多智能体系统中的集体-个体记忆协同
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) ; Beijing academy of blockchain and edge computing(北京区块链与边缘计算研究院) ; National University of Defense Technology(国防科技大学) ; MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)
AI总结 针对多智能体系统记忆易受噪声污染且缺乏结构的问题,提出CoMem架构,通过私有经验沉淀、集体智慧策展和并行双流检索实现集体-个体记忆协同,在ALFWorld和PDDL基准上取得强性能并避免记忆污染。
Comments Submitted to AAAI 2027.9 pages,4 figures
量化特权信息价值:一种PAC-Bayesian方法
机构 * Leiden University(莱顿大学) ; Honda Research Institute Europe GmbH(本田欧洲研究院有限公司)
AI总结 本文提出一种基于PAC-Bayes的算法无关信息论方法,通过比较有无特权信息时的最紧风险界来量化其潜在价值,并引入训练时指标,无需测试数据即可预测性能提升。
Comments 24 pages, 4 figures. Submitted to AAAI 2027
保护您的评分:具有差分隐私保证的接触者追踪
AI总结 针对接触者追踪中风险评分泄露隐私的攻击,提出首个具差分隐私保证的算法,在COVID-19模拟器中实现感染率降低2至10倍。
Comments Accepted to The 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024), presented in oral session
普通、合理的聊天机器人:AI模型是否追踪人类法律判断?
AI总结 本研究比较26个LLM与人类在25项法律合理性判断上的回答,发现聊天机器人总体追踪人类判断,但更同质化、偏向政府和公司,且与特定人口群体更一致。
Comments Accepted to the Ninth AAAI/ACM Conference on AI, Ethics, and Society
在设施选址游戏中最小化不平等
AI总结 本文提出两种新的机制以最小化设施选址游戏中群体效应,统一了多个经典诚实机制,并改进了群体公平目标的近似界限。
Comments Accepted in AAAI 2026
使用纵向表格Transformer预测停电恢复预计时间
AI总结 本研究提出纵向表格Transformer(LTT)模型,将停电恢复时间预测从静态回归改为纵向回归,利用修订序列在六个公司中显著降低误差并改善满意度。
Comments Substantially revised and expanded version. The experimental design and cohort construction were reworked, and all results were recomputed. The previous experimental setup contained cohort-construction and evaluation issues; these have been corrected, and all numerical results have been recomputed. An earlier version was presented at the non-archival AI4UP Workshop at AAAI 2025
Journal ref AI4UP Workshop @ AAAI 2025
在线资源分配中的公平促进
AI总结 针对非营利组织在线资源分配中的内部公平问题,提出两种基于线性规划的采样算法,通过理论竞争比分析和真实疫苗接种数据实验,证明其能有效促进群体公平,尤其在人口比例失衡时。
Comments A preliminary version of this work was presented at the 36th AAAI Conference on Artificial Intelligence. (Corresponding author: Yifan Xu, email: xyf@seu.edu.cn.)
WorldAgen:统一状态-动作预测与测试时世界模型训练
机构 * Northwestern University(西北大学)
AI总结 WorldAgen提出统一框架,联合世界建模与动作预测,并通过测试时训练适应新环境,在CALVIN和LIBERO基准上超越现有最先进方法。
Comments Accepted to AAAI 2026
EmoMed:一种具有实时信息检索功能的多模态医疗支持情感感知智能体
机构 * ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息学与自动化研究所可信人工智能研究中心) ; National University of Science and Technology (NUST) MISIS(国立科技大学MISIS) ; Innopolis University(Innopolis大学) ; SkolTech(斯科尔科沃科技学院) ; SB AI Lab(SB人工智能实验室)
AI总结 EmoMed是一种多模态医疗咨询智能体,通过双重检索机制确保事实可靠性,并根据用户情绪调整响应,实验表明其情感自适应响应在多个模型和指标上优于中性基线,且不损害临床准确性。
Journal ref Workshop SECURE AI4H, AAAI 2026, https://link.springer.com/book/9789819239238
ReBoot:基于CKKS自举的深度神经网络加密训练
机构 * Politecnico di Milano(米兰理工学院)
AI总结 针对同态加密下DNN训练开销大、复杂度高的问题,本文提出基于CKKS的ReBoot框架,通过新型架构、定制打包策略和近似自举实现全加密非交互训练,准确率接近明文训练且性能优于现有方案。
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(29), 24837-24845 (2026)