arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

AAAI Conference on Artificial Intelligence · 会议 · Artificial Intelligence

共收录 9565
2509.23796 2025-12-09 cs.AI cs.MM cs.NE

From Frustration to Fun: An Adaptive Problem-Solving Puzzle Game Powered by Genetic Algorithm

从挫败到乐趣:一种由遗传算法驱动的自适应问题解决拼图游戏

Matthew McConnell, Richard Zhao

AI总结 本文提出了一种基于遗传算法的自适应拼图游戏,通过动态调整难度提升玩家体验,探索问题解决能力的培养方法。

Comments Accepted at the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE-25)

Journal ref Proceedings of the Twenty-First AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE-25), Edmonton, Canada, November, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23787 2025-12-09 cs.CV cs.AI

From Unstable to Playable: Stabilizing Angry Birds Levels via Object Segmentation

从不稳定到可玩:通过物体分割稳定《愤怒的小鸟》关卡

Mahdi Farrokhimaleki, Parsa Rahmati, Richard Zhao

AI总结 通过物体分割和视觉分析,研究提出了一种方法来稳定由PCG生成的《愤怒的小鸟》关卡,提升其稳定性和可玩性。

Comments Accepted at the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE-25)

Journal ref Proceedings of the Twenty-First AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE-25), Edmonton, Canada, November, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09261 2025-12-09 cs.CV

Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling

面向头部的KV缓存压缩以实现高效的视觉自回归建模

Ziran Qin, Youru Lv, Mingbao Lin, Hang Guo, Zeren Zhang, Danping Zou, Weiyao Lin

AI总结 HACK通过面向头部的KV缓存压缩技术,有效降低VAR模型的注意力复杂度和内存开销,实现70%的缓存压缩率和1.57倍的推理加速。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16929 2025-12-09 cs.CV cs.AI

TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解

Shicheng Li, Lei Li, Kun Ouyang, Shuhuai Ren, Yuanxin Liu, Yuanxing Zhang, Fuzheng Zhang, Lingpeng Kong, Qi Liu, Xu Sun

AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。

Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14011 2025-12-09 cs.LG cs.AI cs.NI

DFDT: Dynamic Fast Decision Tree for IoT Data Stream Mining on Edge Devices

DFDT:用于边缘设备的物联网数据流挖掘动态快速决策树

Afonso Lourenço, João Rodrigo, João Gama, Goreti Marreiros

AI总结 DFDT是一种用于边缘设备的内存受限在线学习算法,通过活动感知预剪枝和自适应宽容期提升数据流挖掘效率,减少超参数调优需求。

Comments Accepted at 40th Annual AAAI Conference on Artificial Intelligence (AAAI 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05012 2025-12-09 cs.CV

SAMCL: Empowering SAM to Continually Learn from Dynamic Domains with Extreme Storage Efficiency

SAMCL: 通过极高效存储使SAM持续学习动态领域

Zeqing Wang, Kangye Ji, Di Wang, Haibin Zhang, Fei Cheng

AI总结 SAMCL通过高效存储和模块选择机制,使SAM在动态领域中实现持续学习,减少存储需求并提升领域适应性。

Comments Accepted by AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05698 2025-12-08 cs.CV

OWL: Unsupervised 3D Object Detection by Occupancy Guided Warm-up and Large Model Priors Reasoning

OWL:通过占用引导预热和大模型先验推理实现无监督3D物体检测

Xusheng Guo, Wanfa Zhang, Shijia Zhao, Qiming Xia, Xiaolong Xie, Mingming Wang, Hai Wu, Chenglu Wen

AI总结 OWL通过占用引导预热和大模型先验推理实现无监督3D物体检测,有效提升mAP性能15%以上。

Comments The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05494 2025-12-08 cs.CV

Decoding with Structured Awareness: Integrating Directional, Frequency-Spatial, and Structural Attention for Medical Image Segmentation

基于结构意识的解码:整合方向、频率-空间和结构注意力用于医学图像分割

Fan Zhang, Zhiwei Gu, Hua Wang

AI总结 本文提出基于结构意识的解码框架,整合方向、频率-空间和结构注意力,提升医学图像分割的精度和泛化能力。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05449 2025-12-08 cs.AI

The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems

计划的种子:代理系统构建块中的弱点意志

Robert Yang

AI总结 本文提出将'意志薄弱'作为分析代理AI系统不一致性和目标漂移的基础概念,并引入Akrasia基准以评估模型的自我控制能力。

Comments 4 pages + appendix. AAAI 2026 FAST Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17079 2025-12-08 cs.RO

H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation

H-GAR: 一种通过目标驱动的观察-动作细化的分层交互框架用于机器人操控

Yijie Zhu, Rui Shao, Ziyang Liu, Jie He, Jizhihui Liu, Jiuru Wang, Zitong Yu

AI总结 H-GAR通过目标驱动的观察-动作细化分层框架提升机器人操控的准确性和一致性。

Comments Accepted to AAAI 2026 (Oral), Project Page: https://github.com/JiuTian-VL/H-GAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05835 2025-12-08 cs.CR cs.SD eess.AS

Yours or Mine? Overwriting Attacks Against Neural Audio Watermarking

你是的还是我的?针对神经音频水印的覆盖攻击

Lingfeng Yao, Chenpei Huang, Shengyao Wang, Junpei Xue, Hanqing Guo, Jiang Liu, Phone Lin, Tomoaki Ohtsuki, Miao Pan

AI总结 本文提出针对神经音频水印的覆盖攻击,揭示现有系统安全漏洞,强调未来需加强安全设计。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04946 2025-12-08 cs.LG cs.CL eess.AS

REINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech Translation

REINA:基于正则化熵信息的损失函数,用于高效的同时语音翻译

Nameer Hirschkind, Joseph Liu, Xiao Yu, Mahesh Kumar Nandwana

AI总结 REINA通过正则化熵信息损失函数优化同时语音翻译的延迟与质量平衡,实现21%的权衡改进。

Comments Accepted to AAAI 2026 (Oral Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13131 2025-12-08 cs.LG cs.AI

Detecting the Future: All-at-Once Event Sequence Forecasting with Horizon Matching

预见未来:基于时间 horizon 匹配的全部一次事件序列预测

Ivan Karpukhin, Andrey Savchenko

AI总结 DEF提出了一种基于时间horizon匹配的事件序列预测方法,实现了高精度和多样性的长周期事件预测,并在多个领域取得显著提升。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04764 2025-12-05 cs.AI

Human Cognitive Biases in Explanation-Based Interaction: The Case of Within and Between Session Order Effect

人类认知偏差在基于解释的交互中的体现:会话内与会话间顺序效应的案例

Dario Pesenti, Alessandro Bogani, Katya Tentori, Stefano Teso

机构 * CIMeC, University of Trento(CIMeC、特伦托大学)

AI总结 研究探讨了基于解释的交互学习中顺序效应的影响,发现其在会话内有显著影响,但不会对反馈质量造成重大问题。

Comments 18 pages, 10 figures, published at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22345 2025-12-05 cs.CV

Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment

反向流动:通过反向表征对齐改进规范化流

Yang Chen, Xiaowei Xu, Shuai Wang, Chenhui Zhu, Ruxue Wen, Xubin Li, Tiezheng Ge, Limin Wang

AI总结 通过反向表征对齐改进规范化流,提升生成质量和分类准确性,训练速度提升3.3倍,实现ImageNet新state-of-the-art结果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12679 2025-12-05 cs.CV

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI: 通过多模态网络教程构建大规模GUI代理

Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li

AI总结 TongUI通过多模态网络教程构建大规模GUI代理,利用GUI-Net数据集提升定位和导航性能,优于基线代理10%。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04691 2025-12-05 cs.AI cs.CL cs.MA

Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective

迈向伦理化的大型语言模型多智能体系统:从机制可解释性视角出发

Jae Hee Lee, Anne Lauscher, Stefano V. Albrecht

AI总结 本文从机制可解释性视角出发,提出确保大型语言模型多智能体系统伦理行为的研究议程,聚焦于伦理评估框架、内部机制解析及参数高效对齐技术。

Comments Accepted to LaMAS 2026@AAAI'26 (https://sites.google.com/view/lamas2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04445 2025-12-05 cs.SE cs.AI

Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operation Orchestration

通过分步和回滚功能的操作编排自动化复杂文档工作流

Yanbin Zhang, Hanhui Ye, Yue Bai, Qiming Zhang, Liao Xiang, Wu Mianzhi, Renjun Hu

机构 * Yanbin Zhang, Hanhui Ye, Yue Bai, Qiming Zhang, Liao Xiang, Wu Mianzhi, Renjun Hu(作者)

AI总结 AutoDW通过分步和回滚功能的操作编排,提升复杂文档工作流的自动化效率

Comments 9 pages, 3 figures, accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08003 2025-12-05 cs.CV cs.AI

Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning

锐眼与记忆:视频大语言模型的信息感知视觉标记修剪方法

Jialong Qin, Xin Zou, Di Lu, Yibo Yan, Xuming Hu

AI总结 SharpV通过自适应视觉标记修剪和键值缓存修剪,提升视频大语言模型的效率与可靠性,是首个无需暴露注意力分数的两阶段修剪框架。

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26) Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06299 2025-12-05 cs.CV cs.AI

Physics-Informed Deformable Gaussian Splatting: Towards Unified Constitutive Laws for Time-Evolving Material Field

物理引导的可变形高斯点云:面向时间演化的材料场统一本构定律

Haoqin Hong, Ding Fan, Fubin Dou, Zhi-Li Zhou, Haoran Sun, Congcong Zhu, Jingrun Chen

AI总结 本文提出物理引导的可变形高斯点云方法,通过引入时间变化的本构参数和物理约束,提升动态场景的物理一致性和重建质量。

Comments Accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16717 2025-12-05 cs.CL

Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling

半监督合成数据生成与细粒度相关性控制用于短视频搜索相关性建模

Haoran Li, Zhiming Su, Junyan Yao, Enwei Zhang, Yang Ji, Yan Chen, Kan Zhou, Chao Feng, Jiao Ran

AI总结 本文提出一种半监督合成数据生成方法,通过细粒度相关性控制提升短视频搜索相关性建模效果,实验显示其在推荐系统中提升了CTR、SRR和IUPR

Comments Submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05255 2025-12-05 cs.CV

CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation

CMMCoT:通过多模态链式思考和记忆增强提升复杂多图像理解

Guanghao Zhang, Tao Zhong, Yan Xia, Mushui Liu, Zhelun Yu, Haoyuan Li, Wanggui He, Fangxun Shu, Dong She, Yi Wang, Hao Jiang

AI总结 CMMCoT通过多模态链式思考和记忆增强提升多图像理解的复杂性与准确性

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15177 2025-12-05 cs.LG cs.CY

Optimizing Product Provenance Verification using Data Valuation Methods

利用数据估值方法优化产品溯源验证

Raquib Bin Yousuf, Hoang Anh Just, Shengzhe Xu, Brian Mayer, Victor Deklerck, Jakub Truszkowski, John C. Simeone, Jade Saunders, Chang-Tien Lu, Ruoxi Jia, Naren Ramakrishnan

AI总结 本文提出了一种数据估值框架,通过Shapley值优化SIRA模型的训练数据选择,提升溯源验证的准确性和稳健性,实验证明其在实际应用中的有效性。

Comments Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02568 2025-12-05 cs.CV cs.AI

Surface-Based Visibility-Guided Uncertainty for Continuous Active 3D Neural Reconstruction

基于表面的可见性引导不确定性用于连续主动3D神经重建

Hyunseo Kim, Hyeonseo Yang, Taekyung Kim, YoonSung Kim, Minsu Lee, Jin-Hwa Kim, Byoung-Tak Zhang

AI总结 本文提出基于表面的可见性场(SBV),用于连续主动3D神经重建中估计可见性引导的不确定性,通过学习渲染不确定性并更新表面置信度,提升重建性能达11.6%。

Comments The main claims are the same as in the previous version, but the naming and explanations have been changed. Accepted at AAAI 2026 Artificial Intelligence with Biased or Scarce Data workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09245 2025-12-04 cs.AI

Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search

木星:通过笔记本和推理时的价值引导搜索增强大语言模型的数据分析能力

Shuocheng Li, Yihao Liu, Silin Du, Wenxuan Zeng, Zhe Xu, Mengyu Zhou, Yeye He, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * Microsoft(微软)

AI总结 Jupiter通过将数据分析建模为搜索问题,并结合价值模型和节点访问次数,提升大语言模型在多步推理和工具使用方面的性能。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10543 2025-12-04 cs.RO

MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation

MP1: 均值流使政策学习在1步中适用于机器人操作

Juyi Sheng, Ziyi Wang, Peiming Li, Mengyuan Liu

AI总结 MP1通过MeanFlow范式和轻量级分散损失,在1-NFE中实现更精确且可控的动作轨迹生成,优于现有方法。

Comments This paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏