Pre-training Text-to-Text Transformers for Concept-centric Common Sense
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 4 figures. Code and Data: https://github.com/INK-USC/CALM/
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 4 figures. Code and Data: https://github.com/INK-USC/CALM/
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 pages. 4 figures, 4 tables
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NAACL'19
不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI
AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。
Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis
当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。
Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"
机构 * University of Freiburg(弗赖堡大学) ; Prior Labs(Prior公司) ; ELLIS Institute(ELLIS研究所) ; Tübingen University of Freiburg(弗赖堡大学图宾根分校)
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments Accepted at the NeurIPS 2025 Workshop on Efficient Reasoning. 10 pages, 11 figures
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI
Comments 31 pages, 9 figures, Accepted in the International Journal of Approximate Reasoning (2019)
Journal ref International Journal of Approximate Reasoning, year 2019, vol. 105, pp. 1-26
动态内部场能否调控Transformer的认知?稳态计算控制中的可认证性,而非优越性
机构 * University of Almería(阿尔梅里亚大学) ; Research Centre CIAIMBITAL(CIAIMBITAL研究中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究探究动态内部场能否调控Transformer认知,证明其具有可认证的运行时稳定性,虽未提升认知能力,但可作为可行的计算调控器。
Comments 22 pages, 4 figures. Companion paper: "Where Cognition Lives" (arXiv:2608.22347). Code, preregistrations and results: https://github.com/fmarrabal/miuracognitive
TW-LegalBench: 衡量台湾法律理解
机构 * University of Rochester(罗切斯特大学) ; National Taiwan University(国立台湾大学) ; NVIDIA(英伟达)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出TW-LegalBench基准,包含多项选择、开放式问答和法律判决预测任务,评估13个LLM在台湾法律上的表现,发现顶尖模型通过律师考试但未达到法官检察官标准,且法律条文引用困难。
Comments 10 pages, 2 figures, To appear in ICAIL 2026
采用开源权重大语言模型的角色专业化智能体混合架构用于临床预测
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出角色专业化的开源权重智能体混合架构,结合医学知识检索与相似患者推理,在死亡率预测上媲美闭源模型且标记更多高危患者,为隐私约束下的临床LLM预测提供关键角色设计思路。
Comments COLM 2026 DAIH Workshop
基于良性事实的强化学习会放大模型对已记忆私人数据的泄露
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。
Soft-NBCE: 基于熵加权分块融合的长上下文处理
机构 * Beijing Normal University(北京师范大学) ; Chunjiang Intelligence(春江智能)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对长上下文推理中硬选择策略导致语义碎片化的问题,提出Soft-NBCE,通过熵加权软融合和一致性蒸馏,在保持检索精度的同时提升多跳推理性能。
Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review
DeepRefine: 通过强化学习进行代理编译知识的精炼
机构 * HKUST(香港科技大学) ; HKBU(香港大学) ; Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。
EnSI-RAG:面向长文档问答的实体结构索引增强检索生成框架
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对长文档问答的RAG方法缺陷,提出EnSI-RAG框架,构建以实体为中心的索引,在Loong和Oolong数据集上平均准确率达78.24,较基准提升6.62个百分点,验证了其有效性。
Comments 21 pages, preprint
利用半结构化数据增强大型语言模型(LLMs)在预测性政治问答(QA)中的表现
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对预测性政治问答任务,提出双视图框架PSL,结合半结构化政治记录提取立场与结构信号,在三个真实数据集及多个LLM上均优于基线方法。
灵枢(LingShu):连接中医与现代生物医学的大规模以症状为中心的上下文知识图谱
机构 * Beijing Jiaotong University(北京交通大学) ; Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院) ; Hubei University of Chinese Medicine(湖北中医药大学) ; Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院) ; China Academy of Chinese Medical Sciences(中国中医科学院) ; Xiyuan Hospital(西苑医院) ; National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心) ; Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心) ; Hubei Shizhen Laboratory(湖北时珍实验室) ; Tianjin Ta(天津(此处原文未完整,按原文提取))
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出以症状为中心的LingShu知识图谱,整合多源数据构建混合数据模型,连接中医与现代生物医学,开发集成图可视化等功能的网络平台,为跨医学领域知识关联提供支持。
Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。
Comments 10 pages, 1 figure, 3 tables. Live system: https://askansari.ai . Code: https://github.com/ansari-project
Mint-Agent:引入金融原生智能体基础模型
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。
月球地质学的可验证机器解释
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
利用工具链持续学习:超越模型参数的持续适应
机构 * University of Wollongong(卧龙岗大学) ; Nanjing University(南京大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。
打破最弱环节以规避视觉语言模型
机构 * ESILV(ESILV高等工程师学院) ; Thales(泰雷兹集团)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。
Comments 17 pages
言语化过度自信的不同方面:一项可解释性研究
机构 * CIMeC, University of Trento(特伦托大学认知科学与技术跨学科研究中心) ; DISI, University of Trento(特伦托大学信息工程与计算机科学系) ; Free University of Bozen-Bolzano(波尔扎诺自由大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究以Qwen3-4B为对象,探究大型语言模型的过度自信现象,通过识别转码器特征揭示其默认机制偏向确定性生成,干预不确定性特征可缓解过度自信错误,且相关特征具有跨场景泛化性。
迈向轻量级可靠性:使用软提示缓解大型语言模型中的幻觉
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; National Institute of Standards and Technology(国家标准与技术研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出一种参数高效的软提示方法RCSP,通过对比学习、课程学习和KL正则化平衡事实回忆、幻觉抑制和弃权,在多个QA数据集上优于基线。
Comments 20 pages, 5 tables, 2 figures. Accepted for publication in DBSec 2026
评分需要评分标准,而非智能
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。
SGHA:基于证据的研究问题发现,使用本地语言模型
机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) ; Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。
Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent
上游决策,下游生成:定位与定价多语言MoE模型的跨语言拒绝回路
机构 * Gödel Machines(哥德尔机器) ; IIT Madras(印度马德拉斯理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多语言MoE模型的跨语言拒绝不均衡问题,在sarvam模型中定位到由注意力对抗者约束的混合专家生成器回路,揭示其机制并量化了安全修复的成本。
Comments Accepted to the actionable Interpretability workshop at COLM 2026
AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。
Comments COLM 2026
大型语言模型在规则应用中展现出概念掌握能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。