AEGIS: Preventing Cross-Domain Resource Abuse in MCP
AEGIS:防止MCP中的跨域资源滥用
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AEGIS:防止MCP中的跨域资源滥用
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
MemWM:记忆增强的基于文本的世界模型
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; Zhejiang University(浙江大学) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; TU Berlin(柏林工业大学) ; Kiel University(基尔大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。
Comments Accepted to EMNLP 2026 (Main Conference)
AI时代的统计学
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究探讨AI时代统计学的核心逻辑,提出需通过统计依据关联数据与主张,明确统计学家的核心角色是构建、评判及维护统计依据,为AI与统计结合提供理论框架。
ResiliFlow:面向基础设施感知与灾害韧性的开放交通世界模型
专题命中 规划推理 :planning(abstract)
AI总结 ResiliFlow是面向基础设施感知与灾害韧性的开放交通世界模型平台,整合两类工作空间功能,实现交通模型的可检查复用,支撑研究协作与公众监督。
jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引
专题命中 规划推理 :reasoning(abstract)
AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。
视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。
Comments Accepted at EMNLP 2026 (Findings)
AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现
专题命中 视觉空间推理 :reasoning(title)
AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。
Comments The code and dataset are publicly available. Code: this https URL (https://github.com/lzlfwow/AffordAny). Dataset: this https URL (https://modelscope.cn/datasets/lzlfwow/AffordAny)
用于蛋白质-配体柔性对接的调和扭转扩散
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出Harmony调和扭转扩散框架,通过对齐得分参数化与扩散过程几何,在PDBBind、PoseBusters基准及EBNA1、KRAS G12D案例中提升了蛋白质-配体柔性对接的精度与有效性。
Comments Accepted at the 2026 Workshop on Generative and Agentic AI for Biology (ICML 2026)
大型语言模型是否遵循六度分隔理论?测量长上下文流形中的拓扑压缩
机构 * BRAC University(BRAC大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过分析LLM隐藏状态流形的几何结构,发现深度推理层的语义锚点遵循六度分隔理论,该拓扑特性可用于RAG的零样本幻觉检测,为评估事实可靠性提供了几何指标。
用上下文示例能改进教育图表生成吗?如果幻觉破坏了整体效果就不能
机构 * Aalto University(阿尔托大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过基于RST的上下文示例方法改进教育图表生成,发现高复杂度上下文增加幻觉风险,LLMs难以检测错误。
连接语言与球面空间:面向全景生成的以对象为中心的控制方法
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
COMET:面向视频多模态大语言模型的对比运动增强时序推理
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-Sen University(中山大学) ; Pingan Technology(平安科技)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG
AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。
SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; TUM School of Computation, Information(TUM计算、信息学院) ; Technology, Department of Mathematics(技术学院,数学系) ; Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) ; Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) ; Machine Learning Research(机器学习研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。
Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work
大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示
机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) ; MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) ; Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) ; AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。
KREL:基于大型语言模型对临床证据进行知识引导推理的自动医学编码方法
机构 * The University of New South Wales(新南威尔士大学) ; University of Göttingen(哥廷根大学) ; Macquarie University(麦考瑞大学) ; Beijing Intelligent Decision Medical Technology Co. Ltd(北京智决医疗科技有限公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出KREL框架,将LLM与ICD编码指南知识结合解决自动医学编码问题,在基准数据集上性能优于现有方法。
通过高效的段级到视频级监督增强长视频理解的局部推理能力
机构 * Ant Group(蚂蚁集团)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。
SDAD:面向AI原生软件开发生命周期的规范驱动智能体开发
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出规范驱动智能体开发(SDAD)模型,对比传统敏捷开发,扩展团队角色、量化治理等,论证智能体开发需将工程规范转移至上游规范环节。
经验树:面向自我进化智能体的分层经验管理
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。
弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏
机构 * University of Cambridge(剑桥大学) ; University of California, Berkeley(加州大学伯克利分校) ; UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。
路侧协同自动驾驶:从数据平台到视觉-语言端到端推理
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 针对现有V2X基准的局限,推出V2XBench平台与Chat-V2XBench数据集,提出AURORA端到端协同驾驶框架,其在严重遮挡场景下路径完成率达98.21%、驾驶得分76.02,开创了可扩展的V2X-VLM范式。
Comments 15 pages, 5 figures, under review
GeoExplain:基于街景图像视觉信息层次的多模态推理
机构 * The University of Queensland(昆士兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。
Comments Updated version
S-AI-Recursive:一种生物启发式且时间稀疏的AI架构,用于迭代、反思和节能推理
机构 * Mohammed V University(穆莱·伊斯梅尔大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出S-AI-Recursive架构,通过激素闭环迭代而非单向传递实现推理,结合生物启发式方法和数学模型,验证了时间稀疏性原理。
Comments Preprint. 55 pages. No figures. S-AI-Recursive: Convergent Recursive Reasoning
基于步骤级结果推理与聚合的移动智能体自动轨迹评估
机构 * Jiutian Research(九天研究院) ; China Mobile(中国移动)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。
两个脑袋胜过一个:测试时扩展多智能体协作推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。
当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险
机构 * Lynbrook High School(林布鲁克高中) ; University of Trento(特伦托大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。
Comments 42 pages, 6 figures. Accepted at ACM FAccT '26
以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习
机构 * Nankai University(南开大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; NKIARI
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。
Comments Project page: this https URL (https://orarl.github.io/)
ImmigrationReason:面向法律推理研究的美国移民上诉结构化数据集
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本研究推出ImmigrationReason大规模结构化数据集,涵盖美国移民上诉裁决相关数据,可支撑法律推理领域的结果预测、错误分析及高风险监管智能体设计等研究方向。