arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2604.05378 2026-05-28 cs.CL cs.CV 57%

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性

Kaiser Hamid, Can Cui, Nade Liang

机构 * Texas Tech University(德克萨斯科技大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-05-28 cs.IR cs.CV cs.LG 57%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04631 2026-05-28 cs.AI 57%

Towards automated data analysis: A guided framework for LLM-based risk estimation

迈向自动化数据分析:基于LLM的风险评估引导框架

Panteleimon Rodis

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个在人类指导和监督下利用大语言模型进行数据集风险评估的框架,通过识别模式、生成聚类代码并解释结果,为自动化风险分析奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13748 2026-05-28 cs.CL cs.CV 57%

RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction

RMPL:基于关系感知的多任务渐进学习与分阶段训练的多媒体事件抽取

Yongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao, Yu Hong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出RMPL框架,通过分阶段训练结合单模态事件抽取和多模态关系抽取的异构监督,在低资源条件下实现多媒体事件抽取,并在M2E2基准上取得一致改进。

Comments Accepted by ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11852 2026-05-28 cs.RO cs.AI 57%

Delay-Aware Reinforcement Learning for Highway On-Ramp Merging under Stochastic Communication Latency

考虑随机通信延迟的高速公路匝道合流延迟感知强化学习

Amin Tabrizian, Zhitong Huang, Arsyi Aziz, Peng Wei

机构 * Department of Computer Science, George Washington University, Washington, D.C.(计算机科学系,乔治华盛顿大学,华盛顿特区) Connected and Automated Vehicle Program Manager, Traffic Operations Division, Virginia Department of Transportation(连接与自动化车辆计划主任,交通运营处,弗吉尼亚州交通部) Department of Mechanical & Aerospace Engineering, George Washington University, Washington, D.C.(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对V2I通信随机延迟导致状态观测延迟的问题,提出DAROM框架,通过随机延迟MDP建模和延迟感知编码器恢复马尔可夫性,结合物理安全控制器实现鲁棒控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17737 2026-05-28 cs.CV cs.AI 57%

The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

脚本即一切:一个用于长程对话到电影视频生成的智能体框架

Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个端到端智能体框架,通过训练ScripterAgent将对话转化为精细脚本,并利用DirectorAgent跨场景连续生成策略,实现长程对话到电影视频的连贯生成,显著提升脚本忠实度和时间保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07648 2026-05-28 cs.CL 57%

What Are We Measuring in NLG? A Meta-Analysis of Evaluation Trends 2020-2025

我们在NLG中测量什么?2020-2025年评估趋势的元分析

Jing Yang, Nils Feldhus, Salar Mohtaj, Leonhard Hennig, Qianli Wang, Eleni Metheniti, Sherzod Hakimov, Charlott Jakob, Veronika Solopova, Konrad Rieck, David Schlangen, Sebastian Möller, Vera Schmitt

机构 * Technische Universität Berlin(技术大学柏林) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林) ANITI University of Potsdam(波茨坦大学) CERTAIN

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过元分析14,171篇论文,揭示NLG评估中的三个系统性问题:度量惯性、度量-标准映射问题和验证差距,并提出最小评估清单。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 57%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27240 2026-05-27 cs.CL 57%

ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents

ENPMR-Bench: 情感支持代理的主动记忆检索基准

Xing Fu, Yulin Hu, Mengtong Ji, Haozhen Li, Yixin Sun, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出ENPMR-Bench基准,基于马斯洛需求层次评估情感支持代理主动推断用户潜在情感需求并检索适当记忆的能力,实验表明当前检索范式存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27195 2026-05-27 cs.CL 57%

EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现

Thomas Berkane, Maimuna S. Majumder

机构 * Computational Health Informatics Program(计算健康信息学项目) Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26440 2026-05-27 cs.CL cs.SE 57%

Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks

Conv-to-Bench: 通过代码任务中的用户-助手对话评估语言模型

Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. Mata, Telma W. de L. Soares, Bryan L. M. de Oliveira

机构 * Institute of Mathematics and Computer Science, University of São Paulo(圣保罗大学数学与计算机科学学院) Institute of Informatics, Federal University of Goiás(戈亚斯联邦大学信息学院) HUG Labs(HUG实验室) Advanced Knowledge Center for Immersive Technologies (AKCIT)(沉浸式技术高级知识中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出Conv-to-Bench框架,自动将多轮用户-助手对话转化为结构化需求清单,用于评估大语言模型,在编程领域与人工标准高度一致且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26047 2026-05-27 cs.AI 57%

Retrying vs Resampling in AI Control

AI控制中的重试与重采样

James Lucassen, Adam Kaufman

机构 * Redwood Research

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究AI编码框架中重试与重采样的安全性,发现重试会泄露信息导致攻击更隐蔽,而重采样通过最大怀疑分数审计可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06213 2026-05-27 cs.AI 57%

Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models

超越固定基准和最坏情况攻击:语言模型的动态边界评估

Haoxiang Wang, Da Yu, Huishuai Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出动态边界评估(DBE)方法,通过定位模型在随机采样解码下通过概率接近0.5的边界项,构建统一难度尺度的评估协议,以解决固定基准的饱和问题。

Comments This submission is being withdrawn because it was submitted without the knowledge and authorization of all co-authors. The authors need to resolve this authorship/authorization issue before any public posting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27146 2026-05-27 cs.CL 57%

Learning to Predict Future-Aligned Research Proposals with Language Models

学习用语言模型预测未来对齐的研究提案

Heng Wang, Pengcheng Jiang, Jiashuo Sun, Zhiyi Shi, Haofei Yu, Jiawei Han, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出将研究提案生成重构为时间切片科学预测问题,通过未来对齐分数(FAS)评估模型能否预测截止时间后发表的论文方向,并构建时间一致数据集和推理轨迹进行训练,实验表明未来对齐微调显著提升提案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25152 2026-05-27 cs.AI cs.IR 57%

OMD-GraphRAG: Enhancing GraphRAG with Ontology-Guided Extraction, Multi-Dimensional Clustering and Dual-Channel Fusion

OMD-GraphRAG:利用本体引导提取、多维聚类和双通道融合增强GraphRAG

Jie Wang, Honghua Huang, Xi Ge, Jianhui Su, Wen Liu, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出OMD-GraphRAG框架,通过本体引导知识提取、多维社区聚类和双通道图检索融合,提升GraphRAG在复杂推理和多跳查询中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08267 2026-05-27 cs.CL 57%

Med-CoReasoner: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning

Med-CoReasoner: 通过语言感知的协同推理减少医学推理中的语言差异

Fan Gao, Sherry T. Tong, Jiwoong Sohn, Jiahao Huang, Junfeng Jiang, Ding Xia, Piyalitt Ittichaiwong, Kanyakorn Veerakanjana, Hyunjae Kim, Qingyu Chen, Edison Marrese Taylor, Kazuma Kobayashi, Akiko Aizawa, Irene Li

机构 * The University of Tokyo(东京大学) ETH Zürich(苏黎世联邦理工学院) National Institute of Informatics(日本信息处理学会) Siriraj Informatics and Data Innovation Center(Siriraj信息与数据创新中心) Yale University(耶鲁大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出Med-CoReasoner框架,通过并行英语和本地语言推理、结构化概念抽象及概念级对齐与检索,将本地临床知识整合到英语逻辑框架中,以缩小医学推理中的多语言差距,在MultiMed-X基准上平均提升5%的多语言推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05560 2026-05-27 cs.LG math.OC stat.ML 57%

Incremental Gauss-Newton Descent for Machine Learning

增量高斯-牛顿下降法在机器学习中的应用

Mikalai Korbit, Mario Zanon

机构 * IMT School for Advanced Studies Lucca(利卡学院高级研究学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对标量输出损失逐样本评估的场景,提出增量高斯-牛顿下降法(IGND),通过闭式标量归一化随机梯度实现无需存储或求解曲率矩阵的高效更新,并证明其收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25998 2026-05-26 cs.LG 57%

Causal methods for LLM development and evaluation

因果方法在LLM开发与评估中的应用

Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

机构 * Imperial College London(帝国理工学院伦敦分校) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。

Comments Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25958 2026-05-26 cs.CL cs.CE 57%

PolyGnosis 2.0: Enhancing LLM Reasoning via Agentic Harness Engineering for Polymarket and OSINT Insight Extraction

PolyGnosis 2.0: 通过智能体工程增强LLM推理,用于Polymarket和OSINT洞察提取

Daren Wang, Hong Xu, Jiawen Xian

机构 * The Chinese University of Hong Kong(香港中文大学) Evolution AI Lab(进化人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PolyGnosis 2.0多智能体架构,通过融合Polymarket异常信号与全球开源情报(GDELT)来提取预测情报,并量化“视角错配”作为高阿尔法交易信号,同时评估“工具工程”技术(如反射循环、工具调用、分治和思维链)在高噪声金融领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25708 2026-05-26 cs.CV cs.CL cs.ET 57%

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP: 面向多域任务增量学习的跨模态自适应提示

Sriram Mandalika

机构 * Hasso Plattner Institute(霍普斯·普拉特纳研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对多域任务增量学习,提出跨模态自适应提示方法,利用CLIP文本嵌入空间进行任务路由、置信度估计和编码器适应,在MTIL基准上超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25673 2026-05-26 cs.CR cs.AI 57%

Referential Security as a New Paradigm for AI Evaluations

引用安全性作为AI评估的新范式

Dan Ristea, Vasilios Mavroudis

机构 * University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) King's College London(国王学院伦敦)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对AI系统持续更新导致评估标识不稳定问题,提出引用安全性范式,通过将模型身份作为可验证属性来确保评估的可重复性、纵向审计有效性和跨提供商等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22137 2026-05-26 cs.CL 57%

Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency

跨语言共识:通过多语言自一致性对齐多语言文化知识

Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen

机构 * SAP School of Computing, National University of Singapore(国立新加坡大学计算机学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出一种自监督框架,利用多语言自一致性和自我批评机制,从本地语言表示中提取文化知识并迁移到英语,以缩小跨语言文化知识差距,在BLEnD基准上平均提升英语查询性能5.03%。

Comments Accepted to The 1st Workshop on Multilinguality in the Era of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22143 2026-05-26 cs.CL 57%

Benchmarking and Learning Real-World Customer Service Dialogue

基准测试与学习真实世界客服对话

Tianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu

机构 * ByteDance, Beijing, China(字节跳动,北京,中国)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 针对工业智能客服与真实对话需求脱节的问题,提出OlaBench基准和OlaMind模型,通过蒸馏专家推理模式与分阶段强化学习,在OlaBench上超越GPT-5.2和Gemini 3 Pro,在线A/B测试中问题解决率提升23.67%,人工转接率降低6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17090 2026-05-26 stat.ML cs.LG 57%

Neural Stochastic Differential Equations on Compact State Spaces: Theory, Methods, and Application to Suicide Risk Modeling

紧致状态空间上的神经随机微分方程:理论、方法及其在自杀风险建模中的应用

Malinda Lu, Yue-Jane Liu, Matthew K. Nock, Yaniv Yacoby

机构 * Wellesley College(韦尔斯利学院) Harvard University(哈佛大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 针对生态瞬时评估数据中随机微分方程违反域约束和训练不稳定的问题,提出一种新型表达性SDE,通过约束漂移和扩散确保解在紧致多面体状态空间内,并引入参数化映射任意动力学为满足约束的SDE,在真实数据上提升预测和优化性能。

Comments Accepted at the Symposium on Probabilistic Machine Learning (ProbML) 2026, and at the Methods and Opportunities at Small Scale (MOSS), ICML 2025, Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22634 2026-05-26 cs.SE cs.AI 57%

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

合同技能:面向企业AI代理的GovernSpec设计框架

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出一种基于GovernSpec的合同技能设计框架,通过组织SKILL.md文件为可读任务合同,明确任务意图、边界和验收标准,实验表明该框架能提升生成质量并降低关键错误率。

Comments 15 pages, 5 figures, 4 tables. v2 adds a public-skill A/B study, updates experimental results, and adds a public replication package link: AGI/contractual-skill" target="_blank" rel="noopener">https://github.com/SymbolicLight-AGI/contractual-skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08988 2026-05-26 cs.AI 57%

SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment

SEA-Eval: 超越情景评估的自进化智能体基准

Sihang Jiang, Lipeng Ma, Zhonghua Hong, Keyi Wang, Zhiyu Lu, Tengfei Wang, Shisong Chen, Jinghao Zhang, Tianjun Pan, Weijia Li, Jiaqing Liang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出自进化智能体(SEA)的形式化定义及其最小充分架构进化飞轮,并构建首个专门评估SEA的基准SEA-Eval,通过顺序任务流设计量化进化增益、稳定性和隐式对齐收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09130 2026-05-26 cs.LG 57%

UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation

UniComp: 通过剪枝、量化和蒸馏对大型语言模型压缩的统一评估

Jonathan von Rad, Yong Cao, Andreas Geiger

机构 * University College London(伦敦大学学院) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出UniComp框架,统一评估剪枝、量化和知识蒸馏三种压缩方法,从性能、可靠性和效率三个维度在40个数据集上分析,发现知识偏差、性能与可靠性解耦以及任务特定校准可提升推理性能。

Comments 18 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08652 2026-05-26 cs.AI 57%

Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training

Prompt-and-Check:使用大型语言模型评估基于模拟训练中的通信协议合规性

Vishakha Lall, Yisi Liu

机构 * Centre of Excellence in Maritime Safety(海上安全卓越中心) Singapore Polytechnic(新加坡理工学院) Singapore(新加坡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出Prompt-and-Check方法,利用开源大语言模型通过上下文丰富的提示评估模拟训练中通信协议的合规性,并在海事领域案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24503 2026-05-26 cs.CV cs.AI 57%

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

FoodMonitor:用于可解释合规性分析的多模态大语言模型基准测试

Ruihao Xu, Xingming Shui, Jingxuan Niu, Yiqin Wang, Jilin Yu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对现有视频异常检测缺乏规则驱动可解释性的问题,提出FoodMonitor基准,包含双通道违规标注和两阶段匹配评估协议,揭示当前多模态大语言模型在空间定位和细粒度规则理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24371 2026-05-26 cs.CV cs.CL 57%

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation

SliceWorld: 一种用于CT报告生成的预测性和可控世界状态模型

Yuanhe Tian, Yan Song

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出SliceWorld世界状态框架,通过编码CT切片序列为因子感知的潜在状态,实现未来切片预测、病变因子干预和LLM报告生成,在M3D-Cap和CT-RATE上提升NLG指标和临床评估。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏