GRITHopper: Decomposition-Free Multi-Hop Dense Retrieval
GRITHopper:无分解多跳密集检索
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 GRITHopper-7B通过结合生成和表示指令微调,提出了一种无分解多跳密集检索模型,实现了在分布内和分布外基准上的最佳性能。
Comments Accepted at EACL 2026 Main Conference
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
GRITHopper:无分解多跳密集检索
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 GRITHopper-7B通过结合生成和表示指令微调,提出了一种无分解多跳密集检索模型,实现了在分布内和分布外基准上的最佳性能。
Comments Accepted at EACL 2026 Main Conference
弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统
机构 * Duke University(杜克大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。
Comments 10 pages, 3 figures, 2 tables. Preprint
可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示
机构 * Humanizing Internet
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI
AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。
范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查
机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) ; College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) ; College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) ; Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。
操纵法官:不忠的推理链可能损害智能体评估
机构 * University of Michigan(密歇根大学) ; LG AI Research(LG人工智能研究) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。
Chat-TS: 提升时间序列与自然语言数据的多模态推理能力
机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) ; Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) ; Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。
SCALAR: 基于科学引用的长上下文学术推理实时评估
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。
MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统
机构 * ABB Inc(ABB公司)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。
Comments 12 pages, 2 figures, Submitted to ACL
可解释的深度伪造检测与强化学习增强的自混合图像
机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。
Comments Accepted at ICASSP 2026
分块、检索与重排序:RAG架构在政策文件问答中的实证评估
机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。
奖牌 matters:通过奥运排名探测 LLMs 的失败案例
机构 * AITRCS, Republic of Korea, Seoul(韩国首尔AITRCS研究中心) ; Chung-Ang University, Republic of Korea, Seoul(韩国首尔 Chung-Ang 大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过奥运排名数据探测 LLMs 在知识整合和推理方面的局限性,揭示其在任务二中的失败案例,并提供改进方向及研究资源。
Comments COLM 2025 ORIGen Workshop
迈向可靠的医疗大语言模型:在真实医疗咨询中评估和增强大语言模型信心估计的基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出MedConf框架,通过证据引导的语言自评估方法,在医疗咨询中提升大语言模型的信心估计精度与可靠性。
ALIGNAgent: 适应性学习智能用于知识缺口识别与下一步指导
机构 * Department Of Data Science and Business Analytics, *Department Of Computer Science, Florida Polytechnic University(数据科学与商业分析系、计算机科学系,佛罗里达理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 ALIGNAgent是一种多智能体教育框架,通过整合知识估计、技能缺口识别和定向资源推荐,实现个性化学习,实验证明其在知识熟练度估计上的高精度和高F1分数。
Comments 35 pages
AudioMotionBench: 评估音频大语言模型中的听觉运动感知
机构 * Wuhan University(武汉大学) ; University of Queensland(昆士兰大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AudioMotionBench通过评估音频大语言模型对移动声源方向和轨迹的感知能力,揭示了当前模型在听觉空间推理方面的局限性。
感知挑战:多模态大语言模型能否解决简单感知问题?
机构 * IIT Delhi(德里印度理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。
善良并不总是安全:诊断大语言模型中的情感幻觉
机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。
Comments EACL 2026 Findings
MEDAL:一个用于评估LLM作为多语言开放领域对话评估器的框架
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 MEDAL框架通过多语言多代理方法,评估LLM作为开放领域对话评估者的性能,揭示了现有评判者在检测细微问题上的不足。
Comments EACL 2026
恶意AI群如何威胁民主:代理AI与大语言模型的融合标志着信息战争的新前沿
机构 * Department of Sustainable Communication Technologies, SINTEF Digital(可持续通信技术系,SINTEF数字) ; Max Planck Institute for Security and Privacy(安全与隐私研究所) ; Department of Mathematics, City St George’s University of London(数学系,圣乔治大学) ; Macrostrategy Research Initiative(战略研究计划) ; Human Nature Lab, Yale University(人性实验室,耶鲁大学) ; Department of Politics and Public Administration, University of Konstanz(政治与公共管理系,康斯坦茨大学) ; Harvard Business School, Harvard University(哈佛商学院,哈佛大学) ; Department of Psychology, University of Cambridge(心理学系,剑桥大学) ; Department of Computer Science, University of British Columbia(计算机科学系,不列颠哥伦比亚大学) ; Department of Human Centered Design & Engineering, University of Washington(以人为本设计与工程系,华盛顿大学) ; Department of Psychology, New York University(心理学系,纽约大学) ; Observatory on Social Media and Luddy School of Informatics, Computing, and Engineering, Indiana University(社交媒体观察所和信息、计算与工程学院,印第安纳大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文探讨了恶意AI群通过融合代理AI与大语言模型对民主构成的威胁,并提出多方面的干预措施。
Comments 5 Pages, This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science on January 22, 2026, DOI: 10.1126/science.adz1697
Mecellem模型:从零开始训练并持续预训练的土耳其法律领域模型
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 Mecellem模型通过从零训练和持续预训练,实现了在土耳其法律领域中的高效领域适应,取得前三名成绩并提升生产效率。
Comments 16 png, 1 tex, 1 bib
VitalDiagnosis:基于AI的生态系统,用于24/7生命体征监测和慢性病管理
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 VitalDiagnosis利用AI技术,通过整合可穿戴设备数据与大语言模型,实现24/7生命体征监测和慢性病管理的主动参与,提升患者自我管理能力并减少临床工作量。
Comments Accepted by AAAI 2026 Demo
Persona Switch: 在解码时间混合不同的视角
机构 * Seoul National University(首尔国立大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 Persona Switch是一种在解码过程中动态结合零样本提示和角色扮演提示优势的新方法,通过比较输出置信度来提升模型性能。
Comments EACL'26 Findings, Code is available at https://github.com/junseokkim00/PersonaSwitch
Event-VStream: 基于事件驱动的长视频流实时理解
机构 * University of Houston(德克萨斯大学休斯顿分校) ; The University of Texas at Arlington(德克萨斯理工大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Temple University(特拉华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。
预测编码与信息瓶颈用于大语言模型中的幻觉检测
机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。
在增强医疗LLM中的领域特定知识图谱
机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University, Indianapolis, IN, USA(信息学、计算与工程学院,印第安纳大学,印第安纳波利斯,IN,USA) ; School of Medicine, Indiana University, Indianapolis, IN, USA(医学学院,印第安纳大学,印第安纳波利斯,IN,USA) ; Department of Biomedical Engineering and Informatics, Indiana University, Indianapolis, IN, USA(生物医学工程与信息学系,印第安纳大学,印第安纳波利斯,IN,USA)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究探讨了在医疗LLM中利用领域特定知识图谱提升检索增强生成的效果,发现精准匹配的图谱检索优于随意联合,且模型大小和温度对性能影响各异。
超越标记:面向大语言模型的概念级训练目标
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出概念层面训练目标,通过整合概念监督提升大语言模型的语义理解和泛化能力。
大语言模型能识别税务滥用吗?
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究大语言模型能否识别和分析美国税务最小化策略,发现其能生成新颖策略,可能革新税务机构应对税务滥用的方式。
Comments 9 pages
高效多模态大语言模型:综述
机构 * Youtu Lab, Tencent(腾讯优图实验室) ; SJTU(上海交通大学) ; BAAI(北京人工智能研究院) ; ECNU(华东师范大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文综述了高效多模态大语言模型的发展现状,探讨了其高效结构、策略及应用,并展望了未来研究方向。
Comments Accepted by Visual Intelligence
Journal ref Visual Intelligence, Volume 3, article number 27, (2025)