AI Governance for Institutional Readiness in Finance
金融领域机构准备状态的AI治理
专题命中 规划决策 :agentic(abstract,abstract_cn)
AI总结 针对金融领域智能体AI治理滞后于部署的问题,本文提出四层可计算AI治理框架,通过实证研究验证其有效性并给出90天实施序列,明确跨主体风险控制的可转移措施。
Comments 44 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
金融领域机构准备状态的AI治理
专题命中 规划决策 :agentic(abstract,abstract_cn)
AI总结 针对金融领域智能体AI治理滞后于部署的问题,本文提出四层可计算AI治理框架,通过实证研究验证其有效性并给出90天实施序列,明确跨主体风险控制的可转移措施。
Comments 44 pages
从神经意图到加密授权:管理智能代理工作流程
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。
确定性视界:当扩展推理失败时工具委托变得必要
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文通过注意力瓶颈定理和确定性视界概念,证明解码器-only注意力在确定性状态追踪任务中存在信息论容量限制,导致扩展推理性能退化,并指出当视界超过19-31时工具委托成为必要。
人工智能参与对专家咨询工作流中信任的影响
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 研究探讨人工智能在专家咨询工作流中对用户信任的影响,发现人类专家使用AI的方式会影响用户对专业知识的信任。
Comments Revised version. Accepted to AIES 2026. Includes technical appendices and additional analyses
利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。
卫星观测揭示海上风电场集群的远距离近地面尾流特征
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 该研究利用7122幅Sentinel-1A/B SAR图像,揭示海上风电场近地面尾流可超100公里、平均降速0.990 m/s,还观测到跨国界尾流相互作用,为尾流特征提供大规模观测表征。
Text2Score:从文本提示生成乐谱
机构 * Queen Mary University of London(伦敦女王学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Politecnico di Milano(米兰理工大学) ; EmotionWave(情绪波)
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。
Comments 9 pages including references, 2 figures
daVinci-kernel:通过强化学习协同进化技能选择、总结与利用的GPU内核优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出daVinci-kernel框架,通过强化学习联合训练技能选择、策略生成和技能总结三个智能体,共享LLM骨干,实现GPU内核优化,在KernelBench上超越先前最优模型。
RecGPT-V3技术报告
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
LH-AVLN:长距离视听语言导航基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Jilin University(吉林大学)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。
Comments 12 pages, 3 figures
FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。
用于多模态计算病理学的配对子宫全切片图像和病理报告
机构 * Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理研究所) ; Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序(CAMP)) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Department of Human Pathology, Juntendo University Graduate School of Medicine(顺天堂大学医学研究生院人体病理学部) ; The Hong Kong University of Science and Technology(香港科技大学) ; Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 研究子宫疾病病理诊断,针对全切片图像与病理报告配对数据集稀缺问题,引入TUM-Uteria数据集,含多对病例及切片级配对,经验证,为计算病理学研究提供支持。
PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化
专题命中 规划决策 :workflow(abstract);agentic(abstract)
AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。
通过共享数据中的移动度量引导基于LLM的人群移动模拟
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性
Transformer 在验证计划能力上的表现
机构 * Saarland University(萨尔兰大学) ; Australian National University(澳大利亚国立大学) ; University of Toulouse / LAAS-CNRS(图卢兹大学 / LAAS-CNRS)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究分析了解码器-only模型验证计划的能力,提出C*-RASP框架以保证序列长度和词汇量增长时的泛化能力,发现某些经典规划领域中Transformer能有效学习验证长计划。
Comments Accepted at ICML 2026
面向专业级机器人乒乓球的仿真到现实迁移的物理模型
机构 * Sony AI, Tokyo, Japan(索尼人工智能,东京,日本) ; Sony AI, Zürich, Switzerland(索尼人工智能,苏黎世,瑞士)
专题命中 规划决策 :agent(abstract);AI agent(abstract)
AI总结 提出空气动力学、球桌碰撞和球拍接触的物理模型,精确捕捉高速高旋球行为,首次训练出能与专业选手对战的机器人乒乓球AI智能体。
Comments 8 pages, 7 figures, additional information: https://ace.ai.sony/, Submitted to IEEE Robotics and Automation Letters (RA-L)
探索-执行链:迈向高效的结构化推理范式
机构 * Qizhi Institute(启智研究院) ; Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Engineering Department, National University of Singapore(新加坡国立大学工程系) ; Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) ; IIIS, Tsinghua University(清华大学人工智能研究院) ; College of Software, Northeastern University(东北大学软件学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。
世界模型批判:一种用于世界建模的生成式潜在预测架构
机构 * Institute of Foundation Models(基础模型研究院) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫德 bin Zayed 人工智能大学) ; School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文从心理学“假设性思维”出发,提出世界模型的核心目标是模拟真实世界的所有可行动可能性,并设计了一种基于状态化、分层、多级、混合连续/离散表示的生成式潜在预测(GLP)架构。
TopBench:表格问答中隐式预测推理的基准
机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) ; National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。
幻觉的统一定义:是世界模型的问题,笨蛋!
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。
Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld
DWM-RO:面向支持SWIPT的卫星-地面异构网络的去中心化世界模型与推理卸载
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 针对SWIPT卫星-地面异构网络中多智能体强化学习样本效率低和协调性差的问题,提出去中心化世界模型与推理卸载框架,通过想象策略训练和边缘协调机制实现快速收敛、高谱效和低约束违规。
PLAGUE:面向多轮利用的终身自适应生成的即插即用框架
机构 * A10 Networks, Inc.(A10网络公司) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出PLAGUE框架,通过终身学习启发的三阶段设计(Primer、Planner、Finisher)实现高效多轮越狱攻击,在o3和Opus 4.1等强安全模型上ASR提升超30%。
Comments Accepted in ICLR 2026
最优返利设计:拍卖市场中的激励、竞争与效率
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 研究拍卖市场中交易所通过返利政策激励做市商、缩小清算价与资产价值价差以提升市场效率的最优设计问题,采用主从博弈框架和深度BSDE方法求解。
为生产大语言模型代理选择和组合运行时架构模式的方法
机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) ; Stanford School of Engineering(斯坦福大学工程学院)
专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE
AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。
Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns
撒更宽的网:面向代码推理的协调 Pass@K 策略优化
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA Research(英伟达研究)
专题命中 规划决策 :planning(abstract,comments);分类 cs.AI、cs.CL
AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。
Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity
月球地质学的可验证机器解释
专题命中 规划决策 :workflow(abstract);分类 cs.CL、cs.LG
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运输成本估计
机构 * Northeastern University(东北大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究电子商务中预订单运输成本估计问题,提出受生产启发的多阶段框架RouteCost,将其分解为多步骤,通过路线加权期望公式汇总成本估计,在大量订单等数据上提高了预测质量和校准,保留了路线级可解释性。