TWICE: Modeling the Temporal Evolution of Personalized User Behavior via Event-Driven Agents
TWICE:通过事件驱动代理建模个性化用户行为的时间演化
专题命中 推理评测 :planning(abstract)
AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
TWICE:通过事件驱动代理建模个性化用户行为的时间演化
专题命中 推理评测 :planning(abstract)
AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。
ShellGames: 基于LLM的推测性SSH欺骗
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 针对LLM在欺骗系统中缺乏持久状态、输出不一致等问题,提出ShellGames,结合思维链、记忆管理、推测执行等五种技术,在正确性、一致性、状态跟踪和鲁棒性上显著优于基线。
ICBCBench:面向金融深度研究的行业联盟基准
专题命中 推理评测 :reasoning(abstract)
AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。
Comments 33 pages, 14 figures. Preprint. Under review
CIAN:基于检索增强生成的事件丰富图像描述的多阶段框架
机构 * University of Science, Ho Chi Minh City(胡志明市理科大学) ; Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出多阶段框架CIAN,通过检索相关文章并利用LoRA微调Qwen模型生成叙事,结合N-Gram精炼,在OpenEvents-V1上提升CIDEr从0.030到0.094,实现事件丰富的图像描述。
Comments SOICT 2025
基于不确定性引导的LLM辅助的弃权感知个性化物体重排
机构 * Concordia University(康考迪亚大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出APOLLO框架,结合轻量级个性化嵌入模型与选择性大语言模型辅助,通过不确定性估计在模糊决策时调用LLM,实现高效、隐私保护的弃权感知物体重排。
Comments Accepted at the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。
Comments 28 pages, 11 Figures
IndustryBench-MIPU:面向工业产品的多图像属性值提取基准
机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) ; Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
机构 * University of Arkansas, USA(美国阿肯色大学) ; Google Research, Google(谷歌研究院) ; University of Liverpool, UK(英国利物浦大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。
BusterX:基于MLLM的AI生成视频伪造检测与解释
机构 * University of Liverpool, UK(利物浦大学) ; Nanyang Technological University, SG(南洋理工大学) ; The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) ; Wuhan University(武汉大学) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) ; Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) ; Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。
Comments 13 pages, 5 figures
信任错误理由的正确预测:基于LIME的肺癌诊断深度学习可解释性分析
机构 * Caldwell University School of Business and Computer Science(考德威尔大学商业与计算机科学学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究通过LIME分析三种深度学习模型(CNN、ResNet50、ViT)在肺癌CT分类中的决策一致性,发现预测高度一致但解释区域差异显著,表明预测一致性不能替代推理一致性。
AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准
专题命中 推理评测 :reasoning(abstract)
AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。
长视频中的条件多事件时间定位
机构 * University of Central Florida(中佛罗里达大学) ; Qualcomm AI Research(高通人工智能研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。
自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准
机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)
专题命中 推理评测 :planning(abstract)
AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。
LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。
文档到LLM供应链中的语义完整性失败
专题命中 推理评测 :reasoning(abstract)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
DynaHMRC: 基于大语言模型的动态任务去中心化异构多机器人协作
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; University of Macau (UM)(澳门大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DynaHMRC去中心化框架,每个机器人作为角色感知的LLM智能体,通过四阶段闭环流程(自我描述、任务分配与领导竞标、领导者选举、反思执行)实现动态异构多机器人协作,并构建基准测试验证其高效性和可扩展性。
HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型
机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。
GridVQA-X: 评估多模态可解释性方法的框架
机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) ; University of Virginia(弗吉尼亚大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。
Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
机构 * Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。
Comments ACL 2026 (Main Conference)
HanDyVQA:面向细粒度手-物交互动态的视频问答基准
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) ; Waseda University(早稻田大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。
Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/
评估LLMs在Android应用中的混淆检测与分类能力
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究通过大规模实验评估大型语言模型(LLMs)在无需手工规则或训练的情况下,通过语义推理检测Android应用中的代码混淆,并与现有SAST方法对比。
SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。
离散概率中的反直觉问题
专题命中 推理评测 :reasoning(abstract)
AI总结 本文收集了一系列离散概率中的反直觉问题及详细解答,旨在挑战启发式推理,评估大语言模型在概率推理中的认知偏差。
Comments Feedback on possible mistakes or typos and suggested additions to the list of problems are welcome at the email address of the authors
DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型
专题命中 推理评测 :planning(abstract)
AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。
利用大型多模态模型导航千兆像素病理图像
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) ; Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。
基于Transformer的乒乓球状态预测器弥合仿真到现实的差距
机构 * Sony AI, Zürich, Switzerland(索尼AI,苏黎世,瑞士) ; Sony AI, Tokyo, Japan(索尼AI,东京,日本)
专题命中 推理评测 :planning(abstract)
AI总结 提出基于Transformer的乒乓球状态预测框架,利用注意力机制建模长程时间依赖,结合大规模真实数据集,并引入SPAD策略替换仿真器,无需重新训练即可缩小sim2real差距。
面向部署的可解释AI辅助eBPF/XDP缓解框架在物联网边缘的应用
专题命中 推理评测 :reasoning(abstract)
AI总结 提出一种基于Linux的物联网边缘网关框架,结合资源感知的AI风险评分、事件级可解释性和eBPF/XDP限界缓解,实现可部署的异常流量管控。
Comments 59 pages, 2 figures, 12 tables. Conceptual framework and research agenda for explainable AI-assisted eBPF/XDP mitigation at the IoT edge. Corrected truncated abstract metadata
什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断
机构 * HKUST(香港理工大学) ; FDU(福建大学) ; ZJU(浙江大学) ; NUS(新加坡国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。
ReMoT: 基于运动对比三元组的强化学习
机构 * Xi’an Jiaotong University(西安交通大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。
Comments CVPR 2026 Highlight