Bielik 11B v3: Multilingual Large Language Model for European Languages
Bielik 11B v3:面向欧洲语言的多语言大语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Bielik 11B v3:面向欧洲语言的多语言大语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。
上下文学科与性能相关性:分析在不同上下文长度下LLM性能及质量退化
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了不同上下文长度下LLM性能与质量退化的关系,发现KV缓存增长导致性能非线性退化,并揭示了MoE架构在高token体积时受基础设施瓶颈影响的问题。
Comments 22 pages, 6 figures
PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。
IntAgent:基于网络切片分析功能的意图LLM代理面向下一代高级网络
机构 * University of Guelph(圭尔夫大学) ; Qatar University(卡塔尔大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 IntAgent通过整合NWDAF分析与工具,实现基于意图的网络自动化管理,提升网络操作的智能化和动态响应能力。
Comments conference
AgenTRIM:代理AI的工具风险缓解
机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) ; Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。
Comments Under review
遵循TRACE:基于多智能体模型的结构化共情响应生成路径
机构 * School of Advanced Technology (SAT) Xi'an Jiaotong-Liverpool University, Suzhou, China(先进技术学院(SAT)西安交通大学利物浦大学,苏州,中国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 TRACE通过结构化分解任务,结合深度分析与生成能力,提升共情响应生成的性能和可解释性。
ARC:面向长周期信息检索代理的主动与反思驱动上下文管理
机构 * Peking University(北京大学) ; Beihang University(北京航空航天大学) ; Qiyuan Tech(启元科技)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。
Comments 15 pages, 5 figures
像人类学习:利用元认知反思实现高效的自我改进
机构 * Nanyang Technological University(南洋理工大学) ; A*STAR ; Chang’an University(长安大学) ; Nankai University(南开大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 MARS通过整合基于原则和程序性的反思,实现高效自我改进,优于现有系统并降低计算开销。
稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性
机构 * Workday Inc.(Workday公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。
RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助
机构 * School of Information ; Software Engineering, University of Electronic Science ; School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China ; Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science ; Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences ; Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China ; School of Medicine, University of Electronic Science ; Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 RPIQ通过残差投影多协作闭环和单实例量化方法,实现大规模模型在4位表示下的高效压缩,显著降低内存消耗并保持高性能,适用于视障辅助系统。
MIRAGE:探索大型语言模型在复杂社会互动环境中的表现
机构 * Institute of Big Data, Fudan University(复旦大学大数据研究院) ; Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院) ; School of Computer Science, Fudan University(复旦大学计算机学院) ; Xiaohongshu Inc.(小红书公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 MIRAGE通过谋杀谜案游戏评估LLMs在复杂社会互动环境中的表现,揭示其在信任、线索调查、互动和指令遵循方面的挑战。
CODE:一种基于矛盾的 deliberation 延伸框架,用于对抗检索增强生成中的过度思考攻击
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出 CODE 框架,通过构造污染样本引发 RAG 系统的过度思考攻击,导致推理标记消耗激增,同时不影响任务性能。
Comments 12 pages with 7 figures
表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。
Comments AAAI 2026
CoT Referring: 通过 grounded 推理改进指称表达任务
机构 * Adobe Research(Adobe研究院) ; Northeastern University(东北大学)
专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。
Comments MLLM, Referring Expression Segmentation
从链式到图式:面向通用领域LLM的自结构化推理
机构 * University of Tokyo(东京大学) ; Texas A&M University(德克萨斯大学) ; University of Cambridge(剑桥大学) ; Yale University(耶鲁大学) ; Xiaomi EV(小米电动汽车) ; Henan University(河南大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出自图推理框架SGR,通过结构化图表示提升LLM在通用领域问答中的推理一致性与准确性。
GeoSteer: 通过潜在流形梯度实现忠实的思维链引导
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract,comments);CoT(abstract);分类 cs.CL
AI总结 GeoSteer通过学习高质量CoT轨迹的低维流形,利用梯度引导提升LLM中间推理质量,实验显示在GSM8k数据集上准确率和推理质量均显著提升。
Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)
大语言模型推理的全面评估:从单模型到多智能体范式
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本研究全面评估了LLM推理范式,包括单模型和多智能体系统,通过新基准测试揭示了不同范式在成本与准确率之间的权衡。
感知、理解和推理,一个用于视频虚假新闻检测的多模态基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出POVFNDB多模态基准,通过10个任务系统评估MLLMs在视频虚假新闻检测中的感知、理解和推理能力,并通过微调Qwen2.5VL-7B-Instruct达到最先进的性能。
DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集
机构 * Imperial College London(帝国理工学院伦敦分校) ; Istanbul Medeniyet University(伊斯坦布尔医学大学) ; Usak Research and Training Hospital(Usak研究与培训医院) ; Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) ; Ipswich Hospital(伊普斯韦奇医院) ; Medicana Atakoy Hospital(Medicana阿塔基医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。
推理稳定点:一种训练时的信号,用于稳定证据和捷径依赖
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出推理稳定点(RSP)作为训练时的信号,用于监测微调过程中决策证据的变化,并帮助选择稳定证据区域的检查点。
Comments 8 pages, Submitted to ACL Rolling Review and is under review
基于像素级精度的推理:QVLM架构与SQuID数据集用于定量遥感分析
机构 * Department of Machine Learning, NEC Laboratories America(机器学习系,NEC美国实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出QVLM架构和SQuID数据集,通过解耦语言理解和视觉分析,提升定量空间推理的准确性。
Comments Submitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565
通过结构化诊断推理数据和强化学习增强临床诊断探究
机构 * Baidu Inc.(百度公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 Dr. Assistant通过结构化诊断推理数据和强化学习提升临床诊断能力,优于开放源代码模型并接近闭源模型表现。
ChatAD: 基于推理增强的多轮指令演化的时序异常检测
机构 * Nankai University(南开大学) ; Microsoft Research Asia(微软亚洲研究院) ; Huanjiang Laboratory(焕江实验室) ; University of Manchester(曼彻斯特大学) ; Nanjing University(南京大学) ; Griffith University(格里菲斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 ChatAD通过多智能体演化算法和Kahneman-Tversky优化,提升了时序异常检测的推理能力和跨任务泛化性能,实现了显著的准确率和F1值提升。
OpenExempt:法律推理的诊断基准及自定义基准框架
机构 * Northwestern University(西北大学) ; Adobe Research(Adobe研究) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 OpenExempt通过动态生成法律推理任务和解决方案,提供一个用于诊断评估的基准和框架,揭示模型在复杂推理中的性能差异。
Comments 25 pages, 9 Figures, 15 tables
分歧作为数据:多智能体系统中的推理轨迹分析
机构 * University at Albany(纽约州立大学阿尔巴尼分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Arizona State University(亚利桑那州立大学) ; Le Mans University(勒曼大学) ; University of California, Irvine(加州大学尔湾分校) ; Indian Institute of Technology Bombay(印度班加罗尔理工学院) ; Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering))
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出利用LLM代理生成的推理轨迹分析分歧,通过余弦相似度检测和量化代理间的分歧,提升定性编码的解释实践和方法论严谨性。
Comments LAK 2026 conference paper, 7 pages
大语言模型推理能力的进步促进了临床问题解决的灵活性
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 大语言模型推理能力的提升增强了其在临床问题解决中的灵活性,使其在医学推理任务中表现接近人类水平。
Comments 10 pages, 6 figures
推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型
机构 * National Technical University of Athens(国家技术大学雅典) ; Instituto de Telecomunicações(电信研究所)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。
CellularSpecSec-Bench: 一个分阶段的基准,用于基于证据的解释和3GPP规范的保安推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 CellularSpecSec-Bench通过分阶段基准和统一框架,提升对3GPP规范的解释和安全推理能力。
MMedExpert-R1: 通过领域特定适应与临床指南强化多模态医学推理
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Renmin University of China(中国人民大学) ; School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 MMedExpert-R1通过领域特定适应和临床指南强化,提升多模态医学推理能力,实现多专科对齐和高精度推理性能。
STRIDE-QA:用于城市驾驶场景时空推理的视觉问答数据集
专题命中 推理评测 :reasoning(title,abstract)
AI总结 STRIDE-QA通过大规模视觉问答数据集提升自动驾驶中动态交通场景的时空推理能力,显著提升VLMs在空间定位和未来运动预测中的表现。
Comments Accepted to AAAI 2026 (Oral). project page: https://turingmotors.github.io/stride-qa/