EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents
EviGraph:面向信息检索智能体的可验证证据构建
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
EviGraph:面向信息检索智能体的可验证证据构建
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。
双信息引导的垂直扩展用于任意时间冲突搜索中的多目标节点选择
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 提出DIVE策略,通过最佳边界搜索与深度优先搜索结合,在保持最优性的同时减少搜索中断、提供早期可行解并降低内存占用。
PATE-Forensics:以通用多模态大语言模型(MLLM)为工具的可解释深度伪造取证方法
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 工具调用 :agent(abstract);tool use(abstract)
AI总结 本研究提出PATE-Forensics,采用“感知即工具”范式,基于DINOv3构建取证感知工具,结合通用MLLM实现可解释深度伪造取证,在DDL-X Track 3数据集上取得0.89的最佳官方分数,较次席高出0.19分。
Comments 9 pages, 3 figures, 2 tables; DDL-X Track 3, IJCAI 2026 AI Safety Workshop
DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调
机构 * ByteDance(字节跳动) ; University of Science and Technology of China(中国科学技术大学)
专题命中 工具调用 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。
OneDSE:面向样本高效设计空间探索的指标条件逆建模与主动搜索
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 OneDSE通过MIND与SAIL统一CPU设计的短视距预测和长视距优化,在TailBench等测试中大幅减少评估次数,性能优于ArchGym遗传算法等基线,还可扩展到其他硬件设计场景。
MultiStructRNA:用于多算法RNA二级结构预测、集成分析与可视化的Python包
专题命中 工具调用 :agent(abstract);workflow(abstract)
AI总结 MultiStructRNA是一款统一Python工具包,整合多种RNA二级结构预测算法,解决工具碎片化等问题,支持集成分析与可视化,简化RNA结构分析,助力相关工作流程应用。
世界中的世界:闭环世界中的世界模型
机构 * JHU(约翰·霍普金斯大学) ; PKU(北京大学) ; Princeton(普林斯顿大学) ; MIT(麻省理工学院) ; Harvard(哈佛大学)
专题命中 工具调用 :agent(abstract);planning(abstract)
AI总结 研究人员推出首个具身场景闭环世界模型基准平台World-in-World,发现视觉质量不保障任务成功,后训练缩放比升级预训练视频生成器更有效,增加推理计算可提升闭环性能。
Comments ICLR 2026 Oral. Add acknowledgement in arxiv v2. Code is at https://github.com/World-In-World/world-in-world
Ĝ红外搜寻拥有大型能源供应的地外文明。V. 当星系因工业而发光时
专题命中 工具调用 :agent(abstract,abstract_cn)
AI总结 本研究基于恒星族群合成,对129个近邻星系开展戴森球相关技术废热搜寻,未检测到戴森球成分,设定了上限并给出群体约束,还开发了未来技术信号搜寻的框架,指出宁静星系外围是最佳搜寻区域。
Comments 34 pages, 16 figures, 4 tables, submitted to ApJ
超越单轮置信度:面向大语言模型智能体的轨迹适配不确定性量化
专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究探讨单轮UQ方法能否迁移至LLM智能体的交互式轨迹场景,评估三类UQ方法在多轮工具使用数据集上的表现,发现黑盒自一致性通常最优,提示需在轨迹层面重新验证单轮UQ方法。
优化低成本部署强模型:面向进化优化的成本感知跨层迁移
机构 * IBM Research(IBM研究院)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
MemeMind:用于离线上下文优化的参考引导轨迹构建
机构 * Bilibili(哔哩哔哩) ; Fudan University(复旦大学)
专题命中 工具调用 :agent(abstract);tool use(abstract)
AI总结 MemeMind针对离线上下文优化中失败rollout缺失成功示例的问题,通过参考引导构建工具轨迹,在梗解读任务上提升了Qwen3-VL模型的性能。
Comments 24 pages, 16 figures, 8 tables
CRINN:用于近似最近邻搜索的对比强化学习
机构 * DeepReinforce Team(深强化团队)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对近似最近邻搜索算法,提出CRINN新范式,将其优化视为强化学习问题,以执行速度为奖励信号,实验证明该方法在多个基准数据集上有效,且其成功验证了强化学习增强语言模型用于算法优化的有效性。
Comments Preprint Version
学习选择视觉上下文示例
机构 * University of Cincinnati(辛辛那提大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。
Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026
AskChem:面向化学文献综合的以主张为中心的基础设施
机构 * New York University(纽约大学) ; Matterstack, Inc.(Matterstack公司)
专题命中 工具调用 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。
Baikal:面向数据湖深度研究的结构化搜索框架
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 Baikal是面向数据湖深度研究的结构化搜索框架,通过聚类证据为语义区域并自适应搜索,在HybridQA和TAT-QA数据湖上较基线方法提升报告得分28%和36%,展现了结构化语义探索的价值。
通过查询推理和执行对知识图谱中的历史文档进行鲁棒解释
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 研究如何在利用大语言模型泛化能力时保证可靠性,提出智能检索系统,比较传统RAG与智能GraphRAG架构,引入半符号框架,通过单词识别与代码生成协作构建鲁棒检索查询,提升历史文档分析准确性与可验证性。
Comments Accepted at ICDAR2026
数字搜索的演变:从蓝色链接到委托决策
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。
Comments 4 pages, 0 figures
城市电缆路由优化的可变邻域搜索算法中的采样学习
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 针对城市电缆路由优化这一大规模双层组合优化问题,提出学习辅助可变邻域搜索(L-VNS)算法,该算法集成四个关键组件,经实验验证其相比其他方法有优越性,能有效降低建设成本,且具有有效性和鲁棒性。
Comments Accepted by Swarm and Evolutionary Computation
Journal ref Swarm and Evolutionary Computation; Volume 106, June 2026, 102432
结构化输出会削弱44种语言模型的答案多样性
机构 * Cornell Tech(康奈尔理工学院)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。
Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured
什么是前瞻性架构的最小结构?小变压器中跨任务的早期不可撤销承诺
机构 * Cosmic AI
专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文探讨了变压器在何时做出决策以及为何无法纠正决策,提出前瞻性架构概念,通过实验验证了任务特定注意力头对决策的持续影响及架构设计对任务性能的影响。
Comments v2: corrects three citations; reconciles main-text/appendix numbers (the two Llama sweeps now labeled); the effective last-token site differs from Anthropic's newline (position-specificity replicates, site identity does not); adds an erratum on a CLT encoder-hook mismatch (detection-side only); softens novelty, necessity, and depth claims per COLM 2026 reviews; defines prolepsis
AgentCheck:用于基于MCP的大型语言模型智能体的重现-干预-缓解工作台
机构 * University of Utah(犹他大学) ; University of Dhaka(达卡大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究针对工具使用型大语言模型智能体在工具出现问题时开发者难以处理故障的情况,提出AgentCheck开源工作台,通过特定运行和重放方式形成重现-干预-确认循环,能对故障模式进行评估验证,提升智能体故障处理能力。
4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。
Comments 13 pages, 2 figures, appendix
人类-人工智能协同支持集体创造性搜索
专题命中 工具调用 :agent(abstract);AI agent(abstract)
AI总结 本研究探讨了人类与人工智能协同在集体创造性搜索中的作用,发现混合团队在保持多样性的同时表现最佳,凸显了两者互补的协作优势。
布尔查询就足够了吗?
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。
AutoQResearch:基于LLM的闭环策略搜索用于自适应变分量子优化
专题命中 工具调用 :agent(abstract);workflow(abstract)
AI总结 本文提出AutoQResearch,通过LLM引导的闭环实验框架,实现变分量子优化中求解器的自适应配置,通过阶段确认和低成本评估避免过拟合,展示在最大独立集和车辆路径问题上的有效性。
Comments Accepted at the 2026 IEEE International Conference on Quantum Computing and Engineering (QCE 2026), Quantum-GenAI Co-Design & Co-Discovery (QGDD) Technical Papers Track. QCE26 Technical Paper 238
最小 MMAO:一种用于自适应元启发式搜索的资源闭环框架
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 提出基于内源性资源循环的自适应元启发式方法MMAO,通过共享代谢控制器统一调控搜索强度、探索-利用平衡和生命周期更替,在连续和离散域中验证了其跨域稳定性和精简设计。
从抓取到灵巧:大规模抓取预训练用于灵巧操作
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 工具调用 :tool use(abstract);tool-use(abstract)
AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。
Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/
ComAct: 通过COM即行动范式重构专业软件操作
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出COM即行动范式,将专业软件交互转化为确定性程序合成,解决GUI代理的脆弱性和API代理的异构性问题;构建ComCADBench基准和ComActor自校正代理,在工业CAD软件上实现SOTA性能。
可解释的金属有机框架逆向设计:基于大语言模型智能体
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出LLM4MOF框架,利用大语言模型智能体通过化学推理、候选MOF构建和模拟测试的闭环迭代,实现可解释的逆向设计,在六项任务中高效搜索高性能结构。