Reasoning in Bayesian Opinion Exchange Networks Is PSPACE-Hard
专题命中 其他推理 :reasoning(title)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 其他推理 :reasoning(title)
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.CL
AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。
Comments Accepted to appear in the EMNLP 2026 Main Conference
REAP:面向基于大语言模型的闭卷知识库构建的关系感知引出与解析
机构 * VNU University of Engineering and Technology(VNU工程技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 该研究提出REAP系统,基于Mistral-Small-24B-Instruct-2501模型,结合结构化思维链推理等技术,在2026年AKBC共享任务闭卷知识库构建任务中取得宏F1值0.62,相关代码已公开。
激活探针:挖掘模型输出遗漏的表面代码安全信号
专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。
Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026
用于跨语言立场检测的基于理由引导的知识蒸馏
机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Hefei Institute of Technology(合肥学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。
Comments 23 pages, 7 figures, 3 tables
从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐
机构 * William & Mary(威廉玛丽学院) ; Anytime AI
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637
比较BERT句子对分类与少样本LLM提示在检测德国气候新闻中的威胁和解决方案框架
机构 * University of Graz(格拉茨大学) ; Technical University of Graz(格拉茨技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对德语气候新闻句子级框架检测,比较了微调BERT(句子对分类)与少样本LLM提示(Llama 4)方法,BERT在F1上达到0.83,优于LLM的0.78。
Comments 15 pages
Sakana Fugu 技术报告
机构 * Sakana AI
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.LG
AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。
语用理论增强对LLM中隐含意义的理解
机构 * Nara Institute of Science and Technology(奈良科学技術大學) ; RIKEN(理化学研究所) ; Guardian Robot Project(守護機器人專案) ; Kyoto Institute of Technology(京都科技大學) ; Institute of Science Tokyo(東京科學研究所)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究提出以语用理论(如Grice语用学和关联理论)作为提示,引导语言模型逐步推理,在隐含意义理解任务上相比0-shot思维链提升高达9.6%的得分。
Comments Correction of minor typographical errors in the references
挖掘低资源领域适应的有用通用数据
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对低资源领域数据稀缺问题,提出NTK-Selector方法,利用神经正切核从通用数据中筛选有用样本,显著提升领域适应效果。
Comments 39 pages
Hint Tuning:更少的数据造就更好的推理者
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Xiaohongshu Inc.(小红书公司) ; National University of Singapore(新加坡国立大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出Hint Tuning方法,通过自动构建三种提示状态(无提示、稀疏提示、完整提示)的训练数据,使推理模型根据问题难度校准推理深度,仅用1K样本即可在多个主流推理模型上平均减少31.5%的token生成,同时保持竞争性准确率。
重新思考位置编码的作用:无PE的滑动窗口Transformer仍具图灵完备性
机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) ; University of Southern California(南加州大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文证明,在滑动窗口机制下,无需位置编码的Transformer仍可通过窗口演化模拟图灵完备的Post机器,从而具备通用计算能力。
ToolMol:多目标药物发现的进化代理框架
机构 * Department of Computer Science(计算机科学系) ; Skaggs School of Pharmacy(斯卡格斯药学院) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 ToolMol结合多目标遗传算法与代理LLM操作符,通过迭代更新配体群体,实现多目标属性优化,发现具有更强预测结合亲和力的药物候选物。
Comments 9 pages, 5 figures
你能保密吗?语言模型写作中的非自愿信息泄露
机构 * University of Chicago(芝加哥大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究测试语言模型能否隐瞒提示信息,发现五种前沿模型通过主题选择、意象和设定等主题泄露秘密词,泄露率高达79%,且模型主动隐藏时仍可被检测到。
神经垃圾回收:在学习推理的同时学习遗忘
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文提出神经垃圾回收(NGC),通过端到端学习使语言模型在推理时自动管理内存,无需人工设计规则,实现内存压缩与效率提升。
E2E-GMNER:端到端生成式 grounded 多模态命名实体识别
机构 * Dalian Maritime University(大连海事大学) ; Dalian University of Technology(大连理工大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。
Comments Accepted to Findings of ACL 2026
DiffuMask: 用于令牌级提示压缩的扩散语言模型
机构 * University of Washington(华盛顿大学) ; Oracle AI(甲骨文人工智能)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 DiffuMask通过迭代掩码预测实现快速并行提示压缩,保留关键推理上下文,实现80%的提示长度缩减,同时保持或提升准确性。
面向视角的对话编译器用于代理轨迹分析
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出VCC编译器,将原始代理JSONL日志转换为结构化视角,提升轨迹分析质量,减少token消耗并提升模型性能。
Comments Code: https://github.com/lllyasviel/VCC
学习与课程学习:自课程学习的可证明收益
机构 * Microsoft Research(微软研究院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。
Comments 39 pages, 4 figures
PonderLM-2: 在连续空间中通过潜在思想预训练语言模型
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Sun Yat-sen University(中山大学)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。
GemDetox在TextDetox CLEF 2025中的应用:增强大规模多语言模型以在低资源语言上进行文本去毒化
机构 * Centre for Language Technology, University of Copenhagen, Denmark(语言技术中心,哥本哈根大学,丹麦)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 GemDetox在TextDetox CLEF 2025中通过参数高效微调和提示技术提升多语言文本去毒化性能,尤其在低资源语言上表现优异。
LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。
未标记数据可以证明性地增强Transformer的上下文学习
机构 * University of Virginia(弗吉尼亚大学)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出了一种增强ICL框架,通过结合标记和未标记数据,利用CoT提示使Transformer模拟EM算法,从而证明性地提升ICL性能。
Comments Published as a conference paper at NeurIPS 2025
推进人工智能谈判:大规模自主谈判竞赛
机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) ; Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。
通过频率-时间强化学习实现可解释的多类型音频深度伪造检测
机构 * Communication University of China(中国通信大学) ; Machine Intelligence, Ant Group(蚂蚁集团机器智能部) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出FT-GRPO方法,通过频率-时间强化学习实现多类型音频深度伪造检测的可解释性与高性能。
上下文崩溃:上下文学习与模型崩溃
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究探讨了大型语言模型中上下文学习与模型崩溃现象,通过数学分析揭示了上下文长度与模型稳定性之间的关系。
Comments Master's thesis
SpiderGen:面向碳生命周期评估的流程生成方法
机构 * Amazon(亚马逊)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 SpiderGen利用生成式AI生成碳生命周期评估的流程图,准确率达65%,显著降低评估成本和人力投入。
更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正
机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) ; AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。
Comments This paper has been ACCEPTED for publication in ASRU
EEsizer: 基于LLM的模拟和混合信号电路尺寸设计AI代理
机构 * The University of Edinburgh(爱丁堡大学) ; The School of Engineering(工程学院) ; Institute for Integrated Micro and Nano Systems(集成微纳系统研究所)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 EEsizer是一种基于LLM的AI代理,通过整合大语言模型与电路仿真器和自定义数据分析功能,实现了模拟和混合信号电路尺寸设计的自动化,展示了在先进节点上的适应性和鲁棒性。
Journal ref IEEE Transactions on Circuits and Systems I: Regular Papers, 2026