Co-Authoring with AI: How I Wrote a Physics Paper About AI, Using AI
与AI共同撰写:我如何用AI写了一篇关于AI的物理学论文
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文探讨AI在科学写作中的作用,强调人类在保持物理逻辑和学术规范中的关键责任,提出必须发表完整的AI交互记录以确保科学记录的完整性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
与AI共同撰写:我如何用AI写了一篇关于AI的物理学论文
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文探讨AI在科学写作中的作用,强调人类在保持物理逻辑和学术规范中的关键责任,提出必须发表完整的AI交互记录以确保科学记录的完整性。
对软件架构图理解的VLMs基准测试与评估
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。
多模态字体攻击在音频视觉推理中的系统研究
机构 * Boston University(波士顿大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。
当模型知道更多 than 它说:探测类比推理在 LLMs 中
机构 * Cambridge University(剑桥大学) ; Northeastern University(东北大学) ; Athenahealth ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了LLMs在类比推理任务中的表现,发现探测内部表示比提示性能更优,揭示了任务依赖性和提示机制的局限性。
LiquiLM: 通过DCN和LLMs弥合流动性缺陷审计中的语义鸿沟
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文提出LiquiLM框架,结合LLMs和DCN,通过动态交互流动性关键合同与缺陷描述,弥合代码实现与高阶流动性意图间的语义鸿沟,有效检测流动性缺陷。
基于场景图的多模态交通代理:视频理解的模块化框架
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。
FunFact:通过因子图推理构建概率性功能3D场景图
机构 * ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)
专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)
AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。
链式帧:通过帧感知推理推进多模态大语言模型的视频理解
机构 * New York University(纽约大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
从假设驱动的错误分析自动生成难题
机构 * University of Chicago(芝加哥大学)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI;large language model(comments);language model(comments)
AI总结 本文提出了一种新的数学基准生成流程,利用AI生成的假设识别LLM在特定数学概念上的弱点,并生成针对性难题。实验表明,假设准确性与生成难题难度正相关,且该流程可扩展至其他领域。
Comments 8 pages (without reference and appendix), 4 figures, 1 table, accepted by ICLR 2026 Workshop of Logical Reasoning of Large Language Models
SPHINX:一个用于视觉感知与推理的合成环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院) ; University of Washington(华盛顿大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。
Embodied-R1:强化的具身推理用于通用机器人操作
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Embodied-R1,通过引入指向作为统一的中间表示,结合强化微调方法,实现通用机器人操作中的具身推理,展示了在多个基准测试中的卓越性能和零样本泛化能力。
Comments Embodied-R1 technical report v2; Published as a conference paper at ICLR 2026
从感知到行动:弥合推理与决策以实现机器人操作
机构 * Tianjin University(天津大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。
Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/
HI-MoE:基于实例的混合专家架构用于目标检测
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 HI-MoE提出一种分层实例条件混合专家架构,通过两级路由机制提升目标检测效率,尤其在小目标检测上表现优异。
代理联邦学习:分布式训练编排的未来
机构 * Institute of Computing, University of Campinas(坎皮纳斯州立大学计算研究所) ; Hub of Artificial Intelligence and Cognitive Architectures - H.IAAC(人工智能与认知架构中心 - H.IAAC)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文提出代理联邦学习框架,通过语言模型代理自主协调,缓解客户端异质性和系统动态波动,提升资源利用和公平性,推动联邦学习向去中心化生态系统演进。
基于模式的规划和混合知识工具集的可靠知识图谱三元组验证
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Bay Area International Business School, Beijing Normal University(北京师范大学湾区国际商学院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文提出SHARP,一种无需训练的自主代理,通过动态策略规划、主动调查和证据推理改进知识图谱三元组验证的稳定性与解释性,实验证明其在FB15K-237和Wikidata5M-Ind上准确率提升显著。
基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。
Comments Accepted at FACCT 2026, IoT CPS Week
TraceGuard:结构化多维监控作为抗合谋的控制协议
机构 * Independent Researchers(独立研究人员) ; Apart Research
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。
涌现的组合通信用于潜在世界属性
机构 * Independent Researcher, Amsterdam, Netherlands(独立研究者,阿姆斯特丹,荷兰)
专题命中 推理与问题求解 :pretraining(abstract);分类 cs.LG
AI总结 本文研究多智能体通信能否从冻结视频特征中提取离散组合性表示,展示通过Gumbel-Softmax瓶颈和迭代学习发展出无标签的组合协议,验证了感知先验对可通信信息的影响。
Comments 24 pages, 4 figures, 12 tables. Code: https://github.com/TomekKaszynski/emergent-physics-comm
草稿:任务解耦的潜在推理用于代理安全
机构 * National University of Singapore, Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG
AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。
一个面向合成智能的本体-关系-Sophic框架
机构 * University of Science and Technology Beijing(北京科技大学) ; Blekinge Institute of Technology(布莱金厄理工学院)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。
Comments 9 pages, 3 figures
看似简单的规划问题具有计算挑战性:倒计时游戏
机构 * IBM T. J. Watson Research Center(IBM T. J. Watson 研究中心) ; IBM San Jose(IBM 圣何塞) ; Colorado State University(科罗拉多州立大学)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 本文提出基于倒计时游戏的规划基准,该问题具有NP完全复杂性,能有效评估规划能力,实验显示现有LLM方法在该基准上仍面临挑战。
VERDI:嵌入视觉语言模型的自动驾驶推理
机构 * Princeton University(普林斯顿大学) ; Torc Robotics
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。
超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器
机构 * Hanoi University of Science and Technology(河内科技大学) ; Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) ; Nanjing University(南京大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。
Comments Accepted at CVPR2026 Main Track
基于视觉提示的越野制图推理使用多模态大语言模型
机构 * Khalifa University(哈利法大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。
Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。
Comments CVPR 2026
可调节的视觉-语言-动作策略用于具身推理和分层控制
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。
VectraFlow:基于LLM的长时域语义处理数据与事件流
专题命中 推理与问题求解 :LLM(abstract)
AI总结 VectraFlow通过结合LLM与传统关系运算符,实现了对无结构数据流的长时域语义处理,提供连续语义运算符,支持自然语言意图到可执行运算图的转换,实现从原始文本到匹配事件群体的端到端模式检测。
当AI代理像人类一样产生分歧:用于人机协作 moderation 的推理轨迹分析
专题命中 推理与问题求解 :LLM(abstract)
AI总结 本文研究AI代理在仇恨言论 moderation 中的分歧模式,通过推理轨迹分析发现分歧结构比幅度更能预测人类判断需求,提出从共识寻求转向不确定性揭示的多代理设计。
Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)
AutoReSpec:一种利用大语言模型生成规范的框架
机构 * Texas State University(德克萨斯州立大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。
Comments 10 pages
结构化多标准评估大型语言模型:基于模糊层次分析法与DualJudge
机构 * St. Petersburg State University(圣彼得堡国立大学) ; ITMO University(ITMO大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出基于模糊层次分析法的结构化评估方法,通过引入置信度感知的模糊AHP扩展,提升对大型语言模型评估的准确性与稳定性,提出DualJudge框架实现直观与 deliberative评估的互补。