PAM: Training Policy-Aligned Moderation Filters at Scale
PAM:在大规模上训练策略对齐的 moderation 过滤器
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PAM:在大规模上训练策略对齐的 moderation 过滤器
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。
HFS: 为高效视频推理的全局查询感知帧选择
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL
AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。
Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)
智能基础模型:一种新视角来实现通用人工智能
机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) ; Victoria University, Melbourne, Australia(墨尔本维多利亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。
或许与我成交:情绪在多智能体谈判中的作用
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。
Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。
PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预
机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) ; Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) ; Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。
上下文示例抑制大语言模型中的科学知识回忆
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究发现上下文示例会削弱大语言模型对科学知识的回忆能力,使模型更依赖经验模式匹配而非预训练知识。
Comments COLM 2026
通过混合利益相关者协商确定警务AI的风险边界
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究通过包含社区代表、警察和学者的混合利益相关者协商研讨会,评估13个警务AI用例的种族偏见风险,发现多数参与者支持AI采用,仅拒绝3个用例,强调种族公平可优化AI风险-收益分析。
Comments Accepted to AIES 2026
仅追踪所需:面向长文档问答的结构感知按需超图记忆
机构 * University of New South Wales(新南威尔士大学) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; University of Wollongong(伍伦贡大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。
训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。
EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法
机构 * Tsinghua University(清华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。
Comments 9 page, 9 figures
PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理
机构 * Emory University(埃默里大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。
带分层记忆的Mamba:解决长序列建模中的表示瓶颈
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of Oxford(牛津大学) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) ; BrainGalaxy
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。
Comments 19 pages, preprint
DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架
机构 * Uber Technologies, Inc.(优步科技公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。
Comments 12 pages, 6 figures, 6 pages
MAFIA:针对经审计的大语言模型智能体的、基于探测与事实注入的仅查询内存攻击
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对经审计的LLM智能体,提出MAFIA攻击框架,通过放置策略与伪装有效载荷实现高攻击成功率,大幅降低审计检测率,揭示智能体内存系统的关键漏洞。
Comments 17 pages, 5 figures
当教师误导时:感知虚假信号的在线策略蒸馏
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。
Comments 21 pages, 10 figures
LoopMTP:由潜在多令牌预测引导的循环Transformer
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 LoopMTP针对循环Transformer的潜在过度思考问题,通过潜在多令牌预测实现软对齐与轻量门控,使平均准确率提升最高8.1%,15次循环内训练稳定。
LLaDA MoE v2:扩展混合专家扩散语言模型
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。
OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。
别让我主动索要:大语言模型在用于溯因推理的主动多轮信息获取中存在缺陷
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究通过Alien Abduction游戏探究LLMs的主动多轮信息获取能力,发现其在分轮提供证据、自行选择查询时表现欠佳,存在假设验证与停止决策的缺陷。
Comments Preprint
面向社会化人工智能的科学发现新范式
机构 * Baize Research(白泽研究院) ; Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) ; Yunnan Key Laboratory of Artificial Intelligence, Kunming University of Science and Technology(昆明理工大学云南省人工智能重点实验室) ; School of Automation, Southeast University(东南大学自动化学院) ; School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机学院) ; SeetaCloud Technology(思特云科技) ; GPUhub Pte. Ltd.(GPUhub私人有限公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BLAZE社会化科学智能范式,将AI作为科学发现的组织基础设施,整合知识、推理、实验与人类判断,提升科学发现的可追溯性、可重复性与累积性,以扩展集体科学探究的规模与深度。
将量子电路与经典大语言模型分离
机构 * IBM Research(IBM研究院)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI
AI总结 本研究证明了低深度量子计算与经典大语言模型架构在分布和功能上的无条件分离,为大语言模型时代量子优势的研究奠定了基础。
Comments 60 pages, 6 figures
VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理
机构 * University of California, Riverside(加州大学河滨分校) ; MBZUAI(穆桑人工智能研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。
Comments Accepted at the Conference on Language Modeling 2026
LLMBDC:面向生物域的基因本体聚类语言模型
机构 * Emory University(埃默里大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。
PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模
机构 * University of Southern California(南加州大学) ; Information Sciences Institute(信息科学研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强
审计序列推荐中的语义增益:一种轻量级恢复测试
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。
以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。
面向LLM智能体的实用在线KV缓存压缩:一项实证研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; LinkedIn(领英公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。
使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Ollama(奥拉马)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。
SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德克萨斯大学) ; Smart Information Flow Technologies (SIFT)(智能信息流技术公司) ; Kudu Dynamics(Kudu动态公司) ; Microsoft(微软)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。
Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)
Journal ref USENIX Security 2026