arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 587 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 587 篇

2409.02228 2026-08-06 cs.LG cs.CL 版本更新 62%

Unforgettable Generalization in Language Models

语言模型的不可遗忘泛化

Eric Zhang, Leshem Choshen, Jacob Andreas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究语言模型通过随机标签微调遗忘技能时的行为差异,发现遗忘泛化程度与初始预测置信度和训练数据表示变异性相关,且遗忘为浅层,凸显技能移除的难度与不可预测性。

Comments 18 pages, 9 figures, published in First Conference on Language Modeling 2024

Journal ref First Conference on Language Modeling (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 62%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26529 2026-08-04 cs.CL cs.AI cs.CV 版本更新 62%

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号

Kwan Soo Shin

机构 * PolymathMinds Lab(PolymathMinds 实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。

Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21848 2026-08-04 cs.CL cs.AI 版本更新 62%

Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

无键注意力:面向高效Transformer的值空间路由与仅值缓存

Xin Gao, Xingming Xu

机构 * York University(约克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出无键注意力机制,通过消除键投影并仅使用查询和值,实现50%的KV缓存减少,同时匹配或超越标准注意力的解码吞吐量,并在多个模型上达到相当或更优的困惑度与下游任务性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19913 2026-08-04 cs.CL cs.AI 版本更新 62%

When LLM Essays Outscore Student Essays: What a Korean Writing Rubric Rewards and Where Readers Disagree

从直觉到校准判断:基于评分标准的专家小组研究人类对LLM生成韩语文本的检测

Shinwoo Park, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过三阶段盲 longitudinal 研究评估人类对LLM生成韩语文本的判断,提出LREAD框架提升准确性与一致性,证明评分标准辅助判断能提高检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07107 2026-08-04 cs.AI cs.CL 版本更新 62%

MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs

MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险

Liang Shan, Kaicheng Shen, Wen Wu, Zhenyu Ying, Chaochao Lu, Yan Teng, Jingqi Huang, Qingshan Liu, Guangze Ye, Guoqing Wang, Jie Zhou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19827 2026-08-03 cs.CL cs.AI cs.IR 版本更新 62%

When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering

当迭代RAG优于理想证据:科学多跳问答中的诊断研究

Mahdi Astaraki, Mohammad Arshi Saloot, Ali Shiraee Kasmaee, Hamidreza Mahyar, Soheila Samiee

机构 * Faculty of Engineering, McMaster University, Canada(麦斯特大学工程学院,加拿大) BASF Canada Inc., Canada(巴斯夫加拿大公司,加拿大)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过化学多跳问答数据集,诊断发现迭代检索-推理循环在科学领域显著优于静态RAG上限,揭示了阶段式检索的优势与失败模式。

Comments 51 pages, 29 figures, Published in Transactions on Machine Learning Research (05/2026). OpenReview: https://openreview.net/forum?id=pa5TnBdyDP

Journal ref Transactions on Machine Learning Research (05/2026), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22546 2026-08-03 cs.CL cs.AI 版本更新 62%

Towards the Holographic Characteristic of LLMs for Efficient Short-text Generation

向LLMs的全息特性迈进:为高效短文本生成而努力

Shun Qian, Bingquan Liu, Chengjie Sun, Zhen Xu, Baoxun Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Platform and Content Group, Tencent(腾讯平台与内容组)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOLO插件,利用语言模型的全息特性提升短文本生成效率,通过提取目标关键词并补充平行文本生成,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25959 2026-07-30 cs.CL cs.AI 版本更新 62%

Detecting Knowledge Inconsistencies Across Text, Tables, and Knowledge Graphs

跨文本、表格和知识图谱检测知识不一致性

Fanfu Wei, Thibault Ehrhart, Raphaël Troncy

机构 * EURECOM(欧洲电信学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究跨文本、表格和知识图谱的知识不一致性检测问题,提出\textsc{Kontrast}框架,通过文本到SPARQL和语言模型推理比较并分类不一致性,实验表明跨模态不一致性常见且有价值,为知识审计提供工具并建立基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22720 2026-07-30 cs.LG cs.CL cs.CV stat.ML 版本更新 62%

CausalGate: Causal Importance Distillation for Transformer Module Pruning

因果门控:用于Transformer模块剪枝的因果重要性蒸馏

Kiran Nair, Smriti Regmi, Rodrigue Rizk

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型自适应推理方法不足,提出CausalGate框架,在校准阶段隔离子层测量语义损伤,再用特定目标和损失将结构重要性提炼为标量门控,经实验验证其在多模型上优于基线,能降低硬件延迟且无操作开销。

Comments In-Review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 62%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 62%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02050 2026-07-28 cs.CY cs.AI cs.HC cs.LG 版本更新 62%

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

人工智能评估中随机对照试验的原则与指南

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。

Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 62%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 62%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 62%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20918 2026-07-21 cs.LG cs.AI cs.SY eess.SY 版本更新 62%

Short-Term Electricity Demand Forecasting for New England: A Comprehensive Machine Learning Benchmark with Weather, Calendar, and COVID-19 Indicators

基于混合Transformer-XGBoost框架的新英格兰短期电力需求预测:融合天气、日历和COVID-19指标

Reza Ghanavati, Behrooz Mosallaei

机构 * Department of Chemical and Materials Engineering, New Mexico State University(新墨西哥州立大学化学与材料工程系) Department of Electrical and Communications Engineering, New Jersey Institute of Technology(新泽西理工学院电气与通信工程系)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出混合Transformer-XGBoost框架,集成天气、日历和COVID-19变量,用于新英格兰短期电力需求预测,测试RMSE为8876 MWh,MAPE为2.05%,并发现COVID-19特征在疫情后成为噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09079 2026-07-21 cs.LG cs.AI 版本更新 62%

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文

Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Miao Peng, Nuo Chen, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

机构 * Independent Researchers(独立研究者) Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出前瞻稀疏注意力(LSA),基于DeepSeek-V4架构的神经记忆索引器,通过预测未来上下文需求仅保留关键KV块,在超长上下文场景下将物理KV缓存压缩至全上下文的13.5%,同时保持或略微提升下游准确率。

Comments Technical report. 11 pages. Code and model available at https://github.com/libertywing/FlashMemory-Deepseek-V4 and https://huggingface.co/libertywing/FlashMemory-Deepseek-V4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 62%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22228 2026-07-21 cs.LG cs.AI 版本更新 62%

When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs

当更少的层打破更多的链条:层剪枝损害大语言模型的测试时扩展性

Keyu Wang, Tian Lyu, Guinan Su, Lu Yin, Marco Canini, Jonas Geiping, Shiwei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究层剪枝对大语言模型长链推理中测试时扩展性的影响,经大量实验发现剪枝会严重损害其扩展性,标准微调补救无效,确定了扩展性脆弱机制及应用层剪枝的风险,呼吁重新思考策略并为保推理鲁棒性方法提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 62%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 62%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 62%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11263 2026-07-16 cs.AI cs.LG 版本更新 62%

Bringing Back Rule Induction to Fluid Intelligence Research? An Initial Validation of the ARC-AGI Benchmark in Humans

将规则归纳带回流体智力研究?人类中ARC-AGI基准的初步验证

Jasmin Thelen, Oliver Wilhelm

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究围绕流体智力测量的两种观点,以含100名参与者的研究初步验证ARC-AGI基准用于人类流体智力测量的有效性,发现其与图形流体智力显著相关,为相关研究提供支持并建议嵌入人工智能基准以促进评估与合作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04115 2026-07-15 cs.LG cs.AI 版本更新 62%

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX: 低精度浮点格式的可微分混合精度分配

Giuseppe Franco, Ian Colbert, Pablo Monteagudo-Lago, Felix Marty, Nicholas Fraser

机构 * AMD

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26102 2026-07-14 cs.CL cs.AI cs.CY 版本更新 62%

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

帮助有害:后训练中领域依赖的中期训练同情价值观退化

Jasmine Brazilek, Juliana Seawell

机构 * Compassion Aligned Machine Learning (CaML)(同情心对齐机器学习实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究后训练数据领域对中期训练同情价值观的影响,发现帮助性训练比编程训练更显著降低动物同情和道德推理能力,但跨语言迁移存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏