arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2602.24210 2026-08-31 cs.CL cs.AI 版本更新 84%

From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves

从泄露思维到私有推理:控制LRM对自己说的话

Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)推理过程中隐私泄露问题,提出通过指令跟随(IF)训练和分阶段解码策略(Staged Decoding)增强隐私保护,在IF和隐私基准上分别提升高达20.9和51.9个百分点。

Comments Accepted at EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-08-31 cs.CV cs.RO 版本更新 83%

Reasoning models do not yet follow their reasoning in autonomous driving: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Quentin Delfosse, Christoph Weinhuber, Christian Kinzig, Guillermo S. Gutierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 27 pages; v2: update MMS values (bugfix); v3: more focus on reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 82%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-08-31 cs.SE cs.AI cs.LG 版本更新 81%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28384 2026-08-31 cs.AI 新提交 79%

MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places

MAP:面向现实场所的多模态可访问性规划基准

Jason Armitage, Ioannis Tsochantaridis, Linda Mazzone, Chuqiao Yan, Srini Narayanan, Sarah Ebling

机构 * University of Zurich(苏黎世大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 研究推出首个多模态可访问性规划基准MAP,含声明验证与视觉证据检索两项评估,支持动态信息下的AI系统对比,为服务可访问性需求用户的多模态AI提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28144 2026-08-31 cs.AI 新提交 79%

The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues

权力的形态:面向对话中社会权力推理的多语言框架

Farah Atif, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对现有社会权力计算研究的语言文化局限,提出基于社会科学理论的多语言对话社会权力推理框架,构建含15836个实例的双语语料库,评估6类大模型并发现其与人类推理的差距,为跨文化社会推理提供评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27953 2026-08-31 cs.AI 新提交 79%

The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs

《“如果”的错觉:评估大型语言模型中反事实推理的失效》

Yucheng Wang, Yuetian Du, Zhengyi Liu, Rongyu Zhang, Bing Zhao, Boyu Yang, Ming Kong, Lin Qu, Hu Wei, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出开放域反事实推理基准WhatIfBench及评估框架PRISM,发现前沿LLM在该基准上表现未饱和,存在因果推理缺陷,凸显其反事实推理能力的不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27919 2026-08-31 cs.AI 新提交 79%

From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning

从文档到推理:面向金融数值推理的经验证合成数据流水线与语义感知微调

Lokendra Birla, Milind Savagaonkar, Visnu Srinivasan, Sowmya Rasipuram, Shubhashis Sengupta

机构 * Accenture Labs(埃森哲实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对金融数值推理任务,提出经验证合成数据流水线与语义感知微调方法,结合QLoRA、新型评估指标及改进损失函数,在ConvFinQA数据集上实现问答准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27756 2026-08-31 cs.CL 新提交 79%

Load-Bearing Context: The Question Damage Score for Evaluating Context Reliance in Linguistic Reasoning

承载上下文:用于评估语言推理中上下文依赖程度的问题损伤分数

Neh Majmudar, Elena Filatova

机构 * CUNY(纽约城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出基于53道英国语言学奥林匹克谜题的诊断框架,用问题损伤分数评估大型语言模型的上下文依赖,发现前沿模型在承载上下文移除后仍常产生正确答案,推动相关推理与可解释性研究。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27548 2026-08-31 cs.AI 新提交 79%

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

Nemotron 3.5 内容安全审核器:一款紧凑的多模态、多语言且具备推理能力的内容安全审核器

Varun Singh, Anuj Doshi, Makesh Narsimhan Sreedhar, Shaona Ghosh, Katherine Luna

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出紧凑多模态多语言的Nemotron 3.5 CS安全审核器,兼具低计算成本与推理能力,可覆盖多场景安全审核,还发布配套安全数据集,验证其在多维度评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-08-31 cs.CV cs.AI 版本更新 79%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

Comments Accepted by 2026 IEEE/ACM Symposium on Edge Computing (SEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14240 2026-08-31 cs.AI 版本更新 79%

AFFORDANCE20Q: Evaluating Affordance Reasoning from Physical Properties

AFFORDANCE20Q:从物理属性评估可承担性推理

Yifan Jiang, Meige Yang, Zitong Li, Jay Pujara

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Affordance20Q基准,通过20个问题游戏评估模型从物理属性推理物体可承担性的能力,发现LLM与人类差距约20分,并开发KARI方法提升开源模型达15.2分。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2026-08-31 cs.CV cs.AI 版本更新 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-31 cs.CV 版本更新 78%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian, Yubo Xie

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28407 2026-08-31 cs.CL 新提交 77%

A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

用于可解释多特质作文评分的结构化反馈提取统一框架

Shihang Yang, Sanwoo Lee, Ningning Zhao, Yunfang Wu

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对多特质自动作文评分中反馈与评分分离的问题,提出统一框架HiFTS,结合教师LLM提炼反馈并训练学生模型,在新数据集CFMS-34及ASAP++上取得优异评分与反馈效果。

Comments 14 pages, accepted to EMNLP 2026 Findings. Code: this https URL (https://github.com/Atiyahsama/HiFTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28021 2026-08-31 cs.CR cs.AI cs.MA cs.SE 新提交 70%

Compared to What? A Human-Anchored Security Benchmark for LLM-Generated Infrastructure-as-Code

与什么相比?面向大语言模型生成基础设施即代码的人类锚定安全基准

Animesh Shaw

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究推出GenIaC-SecBench基准,对比大语言模型与人类生成IaC的漏洞密度,发现模型漏洞密度为人类的3.21-3.87倍,供应商扩展思维表现优于提示思维链,还得出可部署性与漏洞无关联等结论,相关代码数据已公开。

Comments 12 pages, 11 figures, 9 tables. Code: this https URL (https://github.com/AnimeshShaw/GenIaC-SecBench) Data: this https URL (https://huggingface.co/datasets/AnimeshShaw/GenIaC-SecBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27729 2026-08-31 cs.CL 新提交 70%

Below the Noise Floor: Bimodal Seed Collapse and Distinct Failure Modes in Small-Model Knowledge Distillation

噪声 floor 之下:小模型知识蒸馏中的双峰种子崩溃与 distinct 失败模式

Dipto Sumit, Sakib Ul Haque, Farig Sadeque

机构 * BRAC University(BRAC大学)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对医疗 API 路由任务发现小模型知识蒸馏存在双峰种子崩溃等失败模式,单种子评估无法检测,仅 progressive_kd 和 rank_kd 可避免崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05183 2026-08-31 cs.CL cs.AI cs.HC 版本更新 66%

The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models

粒度差距:Gemini 模型中谄媚行为的多维纵向审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。

Comments v3: Minor changes, prose improvements, nine sentences reformatted, no change to claims v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28092 2026-08-31 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Do Medical Vision Models Reason About Anatomy? Probing the Spatial Inductive Biases of Learned Visual Representations

医学视觉模型是否对解剖结构进行推理?探究学习到的视觉表示的空间归纳偏置

Naren Akash, Neeraja Ramanan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建SPAR-Bench探测任务,发现医学视觉模型仅记忆标准解剖结构,缺乏特定患者图像内结构对比的推理能力,池化探测会低估其表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28283 2026-08-31 cs.CL cs.AI 新提交 62%

Embedding Models for Stance-Aware Argument Retrieval

面向立场感知的论证检索的嵌入模型

Angelo Sparacino, Francesca Toni, Adam Dejl

机构 * Imperial College London(帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对立场感知的论证检索任务,发现现有稠密嵌入模型存在主题偏好、过度关注极性关键词等问题,通过引入诊断指标并提出结合平衡论证课程与立场反转论证的数据中心方案,缓解了模型过度纠正问题,提升了立场感知的论证检索效果。

Comments CMNA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27514 2026-08-31 cs.CL cs.AI 新提交 62%

Trajectory-Level Speculative Decoding for Diffusion Language Models

用于扩散语言模型的轨迹级推测解码

Tianxiang Pan, Baitao Gong, Mo Guang, Hongwei Yong, Tianpeng Jiang, Yaqian Li, Zheng Cao, Kaiwen Long

机构 * Li Auto Inc.(理想汽车)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型低置信度下吞吐量受限的问题,提出轨迹级推测解码框架,结合置信度分层树探索与分块并行评估,实现7-14倍加速且准确率变化极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24696 2026-08-31 cs.LG cs.AI 版本更新 62%

On-policy Distillation with Verifiable Reward

结合可验证奖励的在线蒸馏

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学LeapLab) Beihang University(北京航空航天大学) SMS, Peking University(北京大学SMS) NLPLab, Tsinghua University(清华大学NLPLab)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2026-08-31 cs.CV cs.AI cs.CL 版本更新 62%

Long Story Short: Story-level Video Understanding from 20K Short Films

长话短说:基于2万部短片的故事级视频理解

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * Ecole Polytechnique(巴黎综合理工学院) IP Paris(巴黎理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视频理解数据集的局限,本文构建了2万部业余电影组成的SF20K数据集及配套问答基准,验证其数据泄露有限,证明指令微调可提升VLMs在长期视频理解上的性能。

Comments International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交 57%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28345 2026-08-31 cs.AI 新提交 57%

AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents

AGENT-O:用于可互操作且受管控的医疗AI智能体的语义智能体卡框架

Pengze Li, Cui Tao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究人员提出AGENT-O模块化本体框架,定义医疗AI智能体的语义智能体卡,评估279篇论文报告完整性,揭示评估规范差距,为结构化报告提供工具但不评估智能体质量与部署就绪性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28315 2026-08-31 cs.AI 新提交 57%

MAIL: Memory-driven, Adaptive, Incremental, and Literature-grounded Framework for Hypothesis Generation in Chemistry

MAIL:用于化学领域假说生成的记忆驱动、自适应、增量式且基于文献的框架

Mahdi Babaei, Xueshen Li, Yutao Kuang, Jolene P. Reid, Yu Gan

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of British Columbia(不列颠哥伦比亚大学) University of Maryland(马里兰大学) Artificial Intelligence Interdisciplinary Institute at Maryland(马里兰人工智能跨学科研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出MAIL框架,将化学假说生成视为记忆驱动的时间推理过程,在TOMATO-Chem与HN-NS数据集上验证其能生成高质量新颖假说,展现了LLMs在化学领域自主探索的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28236 2026-08-31 cs.LG 新提交 57%

D-TAIA: Domain-Aware LLM Adaptation for Multi-Task Predictive Process Monitoring

D-TAIA:面向多任务预测过程监控的领域感知大语言模型适配

Sjoerd van Straten, Christine Jacob, Marwan Hassani

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Wuppertal(伍珀塔尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出D-TAIA框架,通过参数高效微调FM骨干网,结合DATL预训练与FAISS检索等技术,在四个真实事件日志上实现多任务PPM的SOTA或竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27716 2026-08-31 cs.AI 新提交 57%

PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation

PCFBench:产品碳足迹估算的诊断基准

Krishna Rao, Andrew Dumit, Shaena Ulissi, Jacob Feintzeig, P. James Joyce, Daniel Frank, Steven Watson, Jonathan Glidden, Gizem Ilayda Dinc, Travis M. Kwee

机构 * Watershed Technology, Inc.(沃特斯hed科技公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出PCFBench基准,针对现有PCF评估的缺陷,通过含614个条目的6项任务评估前沿LLM,发现其逐步生成PCF的准确率及质量守恒符合率均较低,将发布相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27646 2026-08-31 cs.AI 新提交 57%

If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary

如果智能体是天使,就不需要治理:可信工具边界处带外策略执行

Marc Millstone, Tyler Akidau, Johannes Brüderl, Marat Pekker

机构 * Redpanda Data(红熊猫数据公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出带外策略执行(OBPE)作为智能体推理外的可信边界,通过原型实验将智能体追踪失败率大幅降低,提升了安全有用的任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 57%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏