P-Flow: Prompting Visual Effects Generation
P-Flow:提示视觉效果生成
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
P-Flow:提示视觉效果生成
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。
解析人机协作问题解决中的交互特征与策略:一种认知分布与调节视角
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文通过聚类分析发现,人类与AI协作解决复杂问题时存在三种模式:委托推理、协同解释和委托扩展,其中委托推理组表现最佳,语义相似度最高,而协同解释组自我调节策略使用更频繁。
查询、分解、压缩:面向高效多跳检索的结构化查询扩展
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出DeCoR框架,通过结构化信息精炼提升多跳检索效率,采用查询分解和文档压缩技术,使小模型在复杂检索中表现优于大模型。
Comments Accepted to CIKM 2025
协同感知与生成重组:一种多智能体协作方法用于专家级建筑检查
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出FacadeFixer框架,通过多智能体协作解决建筑立面缺陷检测难题,利用生成代理实现语义重组,提升检测与分割模型的泛化能力。
拓扑引导的生物力学分析:一种白盒框架用于常规CT中脊柱不稳定性的机会性筛查
机构 * Southern Medical University(南方医科大学) ; The Affiliated Cancer Hospital of Zhengzhou University(郑州大学附属肿瘤医院) ; The Chinese University of Hong Kong(香港中文大学) ; Xi'an Jiaotong University(西安交通大学) ; Northwestern Polytechnical University(西北工业大学) ; The University of Hong Kong(香港大学) ; Westlake University(西湖大学) ; Guangdong Provincial People's Hospital(广东省人民医院)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出一种白盒框架,通过拓扑引导的生物力学分析,解决常规CT中脊柱不稳定性的筛查问题,通过几何创新和可解释的AI方法提高诊断准确性。
Comments 11 pages, 3 tables, 2 figures
RSRefSeg 2: 解耦引用遥感图像分割与基础模型
机构 * Beihang University(北京航空航天大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 RSRefSeg 2通过解耦传统三阶段流程,提出双阶段协作框架,结合CLIP的跨模态对齐与SAM的分割泛化能力,提升遥感图像分割精度与复杂语义解释能力。
Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-20, 2026, Art no. 4700420
面向SAGIN资源管理的代理AI:语义感知、编排与优化
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出基于大语言模型的代理AI框架,用于自主管理空间-空气-地面一体化网络资源,通过语义感知、意图驱动编排和自适应学习代理协作,实现动态环境下的高效资源管理。
Comments eg.: 7 pages, 6 figures
可信度至关重要:加密货币关键意见领袖的动机、特征及影响机制
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文研究加密货币关键意见领袖的动机、特征及影响机制,基于SDT理论分析其可信度的自我决定性实践,提出四个可信度标志,并探讨高风险加密生态系统中的可信度设计。
Comments 17 pages, 3 figures. Accepted at ACM CHI 2026, Barcelona
超越自我利益:为类人多智能体交互建模社会导向动机
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出ASVO智能体,通过整合欲望驱动自主性与社会价值导向理论,实现类人多智能体交互中的社会导向动机建模,提升行为自然性和人类拟真性。
Comments 9 pages, 6 figures. Accepted to AAMAS 2026 (Oral)
ClimateAgents: 一种用于社会-气候动态分析的多智能体研究助手
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出ClimateAgents,一种多智能体研究助手,通过整合多模态数据检索、统计建模和自动推理,帮助研究者探索社会-环境动态,提升气候分析的适应性和解释性。
基于强化学习的语言引导标记压缩在大视觉-语言模型中
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; University of Electronic Science and Technology of China(电子科学与技术大学) ; School of Robotics and Advanced Manufacture(机器人与先进制造学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; College of Information and Control Engineering(信息与控制工程学院)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。
coDrawAgents:一种用于组合图像生成的多智能体对话框架
机构 * Lingnan University(岭南大学) ; CMU(卡内基梅隆大学) ; CUHK(香港中文大学) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; SJTU(上海交通大学) ; HKU(香港大学) ; China University of Petroleum(中国石油大学)
专题命中 复杂问题求解 :planning(abstract)
AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。
Comments Accepted to CVPR 2026 Findings
揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。
多模态智能信道建模:从微调大语言模型到预训练基础模型
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。
为AI驱动的敏捷开发培养学生:一种基于项目的AI工程课程
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出一种基于项目的AI工程课程,通过整合敏捷实践与AI赋能的工程,培养学生在AI驱动的敏捷开发中的能力。
AgenticCyOps:保障企业网络操作中的多智能体AI集成安全
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 AgenticCyOps提出了一种基于信任边界的多智能体AI集成安全框架,通过分解攻击面并定义五个防御原则,有效减少攻击向量和提升企业网络安全水平。
Comments 17 pages, 4 figures, 5 tables
VisionCreator-R1: 一种增强反思的原生视觉生成代理模型
机构 * Tencent Hunyuan(腾讯文言) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 复杂问题求解 :planning(abstract)
AI总结 VisionCreator-R1通过引入反射-计划联合优化方法,提升视觉生成代理在单图和多图任务中的表现,优于现有模型。
EmboAlign:通过组合约束对齐视频生成以实现零样本操控
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。
图论同意框架用于多智能体大语言模型系统
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。
Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission
BRIDG-ICS:面向工业5.0 CPS的AI驱动知识图谱用于智能威胁分析
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 BRIDG-ICS通过AI驱动的知识图谱实现工业5.0中网络物理系统的智能威胁分析与韧性评估
Comments 44 Pages, To be published in Springer Cybersecurity Journal
你在做什么?代理LLM车载助手在多步骤处理中的中间反馈影响
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 研究探讨了代理式LLM车载助手在多步骤处理中中间反馈对用户体验的影响,发现中间反馈能提升信任和效率,同时减少任务负荷,提出适应性反馈策略以平衡透明度与效率。
Comments Accepted at CHI 2026
自适应与自纠正的遮蔽预测用于电影预告片生成
机构 * Key Laboratory of Artificial Intelligence Ministry of Education, Shanghai(教育部人工智能重点实验室,上海)
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 SSMP通过双向上下文建模和逐步自纠正方法实现电影预告片生成的最先进结果。
扩展密码学形式化和理论基础以适应人工智能
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。
Earth-Agent: 解锁地球观测的全貌与潜力
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。
Comments Published as a conference paper at ICLR 2026
向人类专家对齐多模态大语言模型:聚焦亲子互动
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。
Comments Accepted at CHI 2026 Full Papers
DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作
机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) ; Samsung AI Center, DS Division(三星人工智能中心,DS部门) ; Hanyang University ERICA(翰洋大学ERICA)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。
Comments Accepted to ICRA2026
GuardAlign: 多模态大语言模型中的测试时安全性对齐
机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Tianjin University(天津大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。
Comments ICLR 2026
Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)
专题命中 复杂问题求解 :CoT(abstract)
AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。
Comments Accepted by CVPR 2026
XR:跨模态代理用于组合图像检索
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升
Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/
Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。