arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2037 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2037 篇

2605.01520 2026-05-05 cs.CV cs.CL 57%

MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

MIRL:基于互信息的强化学习用于视觉-语言模型

Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

机构 * School of Mathematics, Tianjin University, Tianjin, China(天津大学数学学院) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Shanghai Advanced Institute of Finance (SAIFS), East China Normal University, Shanghai, China(上海先进金融研究所(SAIFS),东华大学) ENN Group, Digital Technology Research Institute, China(ENN集团,数字技术研究院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 MIRL通过利用生成描述与视觉输入之间的互信息,解决视觉语言模型在复杂推理任务中的感知误差和幻觉问题,提升回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02443 2026-05-04 cs.LG 57%

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

某些头部,不确定尾部:专家-样本用于测试时缩放在细粒度MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Nanjing University of Science(南京理工大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文研究细粒度MoE在测试时缩放中的性能优化,提出Expert-Sample方法通过保留高置信度选择并引入可控随机性提升生成多样性。

Comments 25 pages, 13 figures

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 57%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 57%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 57%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25634 2026-04-29 cs.CR cs.CL 57%

The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive

大语言模型输出的令人惊讶的普遍性:一种实时验证原语

Alex Bogdan, Adrian de Valois-Franklin

机构 * Evolutionairy AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型输出的词频分布符合Mandelbrot分布,提出一种无需GPU的快速验证方法,用于模型指纹识别和黑盒输出评估。

Comments 25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21525 2026-04-24 cs.CL 57%

Job Skill Extraction via LLM-Centric Multi-Module Framework

通过以LLM为中心的多模块框架进行工作技能提取

Guojing Li, Zichuan Fu, Junyi Li, Faxue Liu, Wenxia Zhou, Yejing Wang, Jingtong Gao, Maolin Wang, Rungen Liu, Wenlin Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出SRICL框架,结合语义检索、上下文学习和监督微调,解决长尾术语和跨域迁移下的工作广告技能提取问题,提升F1指标并减少无效标签。

Comments 5 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15146 2026-04-23 cs.CL 57%

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号

Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过结合模型置信度和动态子组划分,解决测试时间强化学习中多数投票策略导致的确认偏误和稀疏奖励问题,提升大语言模型推理能力。

Comments Accepted to ACL 2025 Main Conference. 15 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 57%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17464 2026-04-21 cs.SE cs.AI 57%

Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications

普罗米修斯计划:通过反向工程可执行规范弥合代理程序修复中的意图差距

Yongchao Wang, Zhiqiu Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出普罗米修斯框架,通过规范推断而非代码生成解决代理程序修复中的意图差距问题,实现了93.97%的正确补丁率和74.4%的救援率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17353 2026-04-21 cs.AI cs.DC 57%

Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling

Hive:一种用于算法和任务级扩展的多智能体基础设施

Zizhang Luo, Yuhao Luo, Youwei Xiao, Yansong Xu, Runlin Guo, Yun Liang

机构 * Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Hive通过算法和任务级扩展提升智能体系统性能,通过Logits Cache减少冗余计算并提升采样速度,Agent-Aware Scheduling优化资源分配,降低热点缺失率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17271 2026-04-21 cs.CL 57%

HopRank: Self-Supervised LLM Preference-Tuning on Graphs for Few-Shot Node Classification

HopRank: 图上基于自监督的LLM偏好微调用于少样本节点分类

Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出HopRank,通过自监督学习在文本属性图上实现少样本节点分类,利用图拓扑结构编码的类别信息,无需标注数据即可提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22297 2026-04-21 cs.AI 57%

Large Language Models as Nondeterministic Causal Models

大型语言模型作为非确定性因果模型

Sander Beckers

机构 * University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于非确定性因果模型的简单方法,用于生成大型语言模型的反事实,该方法无需修改黑盒模型,且能基于其预期语义进行反事实推理。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21471 2026-04-21 cs.CL 57%

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

通过多智能体协作扩展LLM上下文窗口之外的知识输入

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。

Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16116 2026-04-20 cs.ET cs.AI cs.CY 57%

The Relic Condition: When Published Scholarship Becomes Material for Its Own Replacement

遗物条件:当已发表的学术成果成为自身替代的原材料

Lin Deng, Chang-bo Liu

机构 * University of New South Wales(新南威尔士大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过提取学者的推理系统并将其转化为大语言模型的约束,测试学者机器人在学术功能中的表现,揭示了出版系统如何使推理架构成为可替代的原材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG 57%

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14475 2026-04-17 cs.AI 57%

Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve

Evo-MedAgent:超越单次诊断的具有记忆、反思和改进能力的代理

Weixiang Shen, Bailiang Jian, Jun Li, Che Liu, Johannes Moll, Xiaobin Hu, Daniel Rueckert, Hongwei Bran Li, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Evo-MedAgent通过引入自我进化记忆模块,使医疗代理在测试时实现跨案例学习,提升多选题准确率,无需额外训练,适用于任何冻结模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11465 2026-04-16 cs.AI 57%

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

三种角色,一个模型:推理时的角色编排以缩小小规模与大规模代理之间的性能差距

S. Aaron McClendon, Jorge Gallego-Feliciano, Stavros Zervoudakis, Antonios Saravanos

机构 * Aimpoint Digital Labs(Aimpoint数字实验室) New York University(纽约大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 本文研究在推理时仅使用架构支撑是否能提升小模型在复杂多步骤环境中的性能,通过三阶段推理架构使小模型在AppWorld基准测试中任务完成率提升近一倍,展示了结构化推理干预使小模型能与大模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13786 2026-04-16 cs.CL 57%

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

QuantileMark:一种消息对称的多比特水印用于大语言模型

Junlin Zhu, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 QuantileMark通过在连续累积概率区间[0,1)内嵌入信息,实现消息对称的多比特水印,提升水印检测的鲁棒性和生成质量的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12196 2026-04-15 cs.CL 57%

Beyond Majority Voting: Efficient Best-Of-N with Radial Consensus Score

超越多数投票:基于径向共识得分的高效最佳-N选择

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(应用人工智能倡议,德肯大学,澳大利亚)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Radial Consensus Score方法,通过计算答案嵌入的加权Fréchet均值并计算径向距离,实现高效最佳-N选择,优于现有方法并在多代理辩论中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05837 2026-04-14 cs.CL 57%

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

EEPO:通过采样后遗忘的探索增强策略优化

Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong Baptist University(香港浸会大学) LMU Munich(慕尼黑大学) MoE Key Laboratory of High Confidence Software Technologies(教育部高可信软件技术重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 EEPO通过两阶段 rollout 和自适应遗忘机制提升探索能力,在五个推理基准中超越 GRPO,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07153 2026-04-14 cs.AI 57%

ANCHOR: Branch-Point Data Generation for GUI Agents

ANCHOR:用于GUI代理的分支点数据生成

Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan

机构 * Yale University(耶鲁大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 ANCHOR通过分支点生成高质量交互数据,提升桌面环境GUI代理的训练效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20567 2026-04-14 cs.CL 57%

KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling

KCS: 通过知识组合采样多样化多跳问题生成

Yangfan Wang, Jie Liu, Chen Tang, Lian Yan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)

专题命中 测试时计算 :planning(abstract);分类 cs.CL

AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。

Comments Accept by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 57%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG 57%

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 57%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06385 2026-04-09 cs.CL 57%

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

通过强化学习和监督微调驱动的开源大语言模型教学知识优化

Navan Preet Singh, Xiaokun Wang, Anurag Garikipati, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * East China Normal University, Shanghai, China(华东师范大学) Incept Labs, Houston, TX(Incept Labs)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结合强化学习和监督微调的多阶段优化策略,通过EduQwen 32B-RL1、EduQwen 32B-SFT及EduQwen 32B-SFT-RL2等模型,提升大语言模型的教学知识能力,实现跨领域教学知识基准的新状态-of-the-art结果。

Comments * These authors contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06240 2026-04-09 cs.CR cs.AI cs.MA 57%

The Art of Building Verifiers for Computer Use Agents

构建计算机使用代理验证器的艺术

Corby Rosset, Pratyusha Sharma, Andrew Zhao, Miguel Gonzalez-Fernandez, Ahmed Awadallah

机构 * Microsoft Research(微软研究院) Browserbase

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通用验证器,通过四个原则减少噪声、分离奖励信号、区分可控不可控失败、并采用分治上下文管理,提升验证可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 57%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03201 2026-04-06 cs.AI 57%

Coupled Control, Structured Memory, and Verifiable Action in Agentic AI (SCRAT -- Stochastic Control with Retrieval and Auditable Trajectories): A Comparative Perspective from Squirrel Locomotion and Scatter-Hoarding

耦合控制、结构化记忆与可验证行为在代理AI中的应用(SCRAT -- 随机控制与可审计轨迹:从松鼠运动与散落储藏的比较视角)

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文从松鼠生态角度探讨代理AI中控制、记忆与可验证行为的耦合机制,提出结构化记忆模型与延迟验证信号,验证三种假设以提升系统鲁棒性与可靠性。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏