ControlLM: Crafting Diverse Personalities for Language Models
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
Comments 17 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
Comments 17 pages
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.AI
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
Comments Findings of EMNLP 2023. arXiv admin note: text overlap with arXiv:2305.19845
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
Comments Accepted at IJCNLP-AACL 2023 main track
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
专题命中 测试时计算 :CoT(abstract);分类 cs.LG
Comments Accepted at ASE-NIER (2023) track
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
专题命中 测试时计算 :planning(abstract);分类 cs.LG
Comments Accepted to Neural Information Processing Systems (NeurIPS) 2022
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
Comments To appear at NAACL 2022
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
Comments Accepted by IJCAI 2022. arXiv admin note: text overlap with arXiv:2109.04735
专题命中 测试时计算 :planning(abstract);分类 cs.AI
Comments 16 figures
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
Comments The very first versoin. Will be improved in the future
专题命中 测试时计算 :planning(abstract);分类 cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
Comments 11 pages
专题命中 测试时计算 :planning(abstract);分类 cs.AI
Comments To appear at AAMAS 2013
专题命中 测试时计算 :planning(abstract);分类 cs.AI
Comments Appears in Proceedings of the Twenty-Sixth Conference on Uncertainty in Artificial Intelligence (UAI2010)
163×163棋盘的显式82个皇后覆盖及其渐近意义
专题命中 测试时计算 :verifier(abstract,comments)
AI总结 该研究构造了163×163棋盘的显式82个皇后A型1-覆盖,确定γ(Q₁₆₃)=82,并利用其得到更优的皇后图覆盖数渐近系数,还提供了坐标与Python验证器。
Comments 6 pages; includes complete coordinates, a standard-library Python verifier, and a machine-readable certificate. AI-assisted programming and manuscript preparation are disclosed in the paper
循环工程:构建模块、采用情况及影响
专题命中 测试时计算 :verifier(abstract)
AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。
Comments 10 pages, 2 tables, under review
PointRL:从可验证标注证据中学习点级视觉-语言接地
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)
专题命中 测试时计算 :verifier(abstract)
AI总结 PointRL是一种可验证强化学习框架,通过将异构标注证据转换为指向指令并设计多维度奖励,提升了Qwen3.5-4B等模型的点级视觉-语言接地性能,在多个基准上取得显著增益。
EviGraph:面向信息检索智能体的可验证证据构建
专题命中 测试时计算 :verifier(abstract)
AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。
AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全
专题命中 测试时计算 :verifier(abstract)
AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。
智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。
面向视觉-语言-动作驾驶模型的推理时注意力引导
机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。
Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention
Journal ref European Conference on Computer Vision 2026
基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略
机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) ; Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) ; Yale University(耶鲁大学)
专题命中 测试时计算 :planning(abstract)
AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。
Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026
你无需停留在循环中:用于机器人策略改进的智能体机器人循环
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。
Comments Agentic Robotics Preview Version
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。