Emerging Flexible Designs for Geospatial Multimodal Foundation Models
地理空间多模态基础模型的新兴灵活设计
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
地理空间多模态基础模型的新兴灵活设计
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。
LingxiDiagBench: 用于基准测试大语言模型在中文精神科咨询与诊断中的多智能体框架
机构 * Tianqiao and Chrissy Chen Institute(天桥和克里斯西·陈研究所) ; EverMind AI Inc.(EverMind AI公司) ; Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出LingxiDiagBench多智能体框架,包含16K电子病历对齐的合成咨询对话数据集,评估LLM在静态诊断和动态咨询中的表现,发现其对抑郁-焦虑共病识别和12类鉴别诊断准确率低,动态咨询常不如静态评估。
语言模型电路在神经元基上是稀疏的
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文实证发现MLP神经元与稀疏自编码器一样是稀疏特征基,并基于此开发了端到端梯度归因流水线,在多项任务中揭示了因果有效的神经元电路。
Comments ICML Spotlight, camera-ready
DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体
机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。
当相似意味着不同:评估大语言模型在阿拉伯语-希伯来语同源词上的表现
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆扎伊德人工智能大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 针对阿拉伯语和希伯来语同源词、假朋友和借词,构建SemCog Bench基准(1858对词对),评估LLM跨语言语义理解,发现模型依赖表面形式相似性,在假朋友和借词上表现差,上下文帮助有限。
用于配电缺陷检测的多模态智能体:基础模型评估
机构 * Quan Quan
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。
GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试
机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Independent Researcher(独立研究者) ; Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。
Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026
通过波斯谚语条件故事生成实现LLM中的约束语义解压缩
机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) ; School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。
BLUEmed: 基于检索增强的多智能体辩论用于临床错误检测
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出BLUEmed框架,结合混合检索增强生成与多智能体辩论,通过分解临床笔记、检索证据、专家辩论及安全层过滤,在术语替换错误检测中达到最优性能。
Comments Accepted to the IEEE International Conference on Healthcare Informatics (ICHI) 2026
HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测
机构 * Monash University Australia(墨尔本大学澳大利亚) ; The University of Melbourne Australia(墨尔本大学澳大利亚) ; Atlassian USA(Atlassian美国)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。
Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed
Fin-RATE:面向SEC文件的金融分析与追踪评估基准
机构 * Tongji University(同济大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Yale University(耶鲁大学) ; Goldman Sachs(高盛集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM在金融领域分析复杂监管文件的需求,提出基于SEC文件的Fin-RATE基准,通过三种任务路径评估模型,发现跨文档和跨时间分析时性能显著下降。
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准
机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。
离散概率中的反直觉问题
专题命中 推理评测 :reasoning(abstract)
AI总结 本文收集了一系列离散概率中的反直觉问题及详细解答,旨在挑战启发式推理,评估大语言模型在概率推理中的认知偏差。
Comments Feedback on possible mistakes or typos and suggested additions to the list of problems are welcome at the email address of the authors
DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型
专题命中 推理评测 :planning(abstract)
AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。
利用大型多模态模型导航千兆像素病理图像
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) ; Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。
PRISM:用于共情口语对话的韵律集成多智能体推理框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出PRISM多智能体框架,通过解耦语音感知、响应生成和语音合成,并引入韵律到语言翻译机制,实现共情口语对话中的韵律适当性和知识集成。
Comments Accepted to Interspeech 2026
地球科学基础模型:从感知到推理与发现
机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本文综述了地球科学基础模型,探讨了其从感知到多模态推理及科学发现的能力演进,并总结了其在大气、水圈、岩石圈等领域的广泛应用。
G-Long:面向高效长期对话代理的图增强记忆管理
机构 * Sungkyunkwan University(成均馆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出G-Long框架,利用微调小语言模型进行结构化三元组提取和关联检索,并引入注意力感知重要性评分机制,在降低计算开销的同时,在响应生成和记忆检索上达到最优性能。
Comments 22 pages, 8 figures, 14 tables
实用人格:通过桥接推理发现LLM人格
机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, 06974, Republic of Korea(Chung-Ang大学人工智能系) ; Department of Computer Science, University of British Columbia, Vancouver, BC V6T 1Z4, Canada(不列颠哥伦比亚大学计算机科学系) ; Van Lang University, Ho Chi Minh City, Vietnam(文-lang大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出基于桥接推理的框架,通过构建话语级知识图谱捕捉LLM对话中的隐含语义关联,实现从话语连贯性层面发现稳定人格特征,优于基于频率或风格的基线方法。
Comments 15 pages, 4 figures, accepted to ICPR 2026
在你思考之前:系统0、AI中介认知与认知殖民化
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文比较三种AI认知框架,提出系统0具有独特理论地位,并引入“认知殖民化”概念,指出AI系统能将外部利益嵌入自我架构,构成难以察觉的影响。
智能体互联网:大规模通信、协调与集体智能
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; NYU Center for Cybersecurity(纽约大学网络安全中心) ; NYU Tandon School of Engineering(纽约大学坦顿工程学院) ; New York University(纽约大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出智能体互联网(IoAI)愿景,构建异构智能体在云、边缘、设备等环境中发现、协商、通信与协作的开放生态系统,并探讨其架构、机制及关键研究挑战。
生成主义:面向生成式人工智能时代的学习理论
机构 * Department of Education and Human Services, College of Education, Lehigh University(教育与人类服务系,教育学院,莱维大学) ; Department of Community and Global Health, College of Health, Lehigh University(社区与全球健康系,健康学院,莱维大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文批判性审视行为主义、认知主义、建构主义和连接主义四大学习理论在生成式AI时代的局限,提出以“生成主义”为核心的新学习理论,强调人机协作的知识共建。
算法宪政主义
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对AI对社会生活日益渗透的风险,本文提出“算法宪政主义”框架,通过分层架构、算法元推理和协商纠正,应用于Facebook内容审核,并分析其与社会宪政主义的张力及对欧盟数字服务法案的影响。
Journal ref Ind. J. Global Legal Stud. 30 (2023): 81
多令牌残差预测
机构 * New York University(纽约大学) ; New York University Shanghai(纽约大学上海) ; Nos Research(Nos研究) ; Modal
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出了一种轻量级模块Multi-token Residual Prediction,通过利用去噪过程中相邻步骤的logit分布相似性,在单次骨干网络前向传播中实现依赖感知的多令牌去噪,从而在成本较低的情况下提高去噪效率。
见我所见,知我所想:异构智能体间的密集潜通信
专题命中 其他推理 :reasoning(abstract)
AI总结 针对异构智能体间文本通信高损耗问题,提出基于KV缓存变换的密集对齐方法,通过两阶段训练实现跨模型潜空间对齐,在上下文感知和未知场景下均优于基线,计算成本降低2-3倍。