arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-19 至 2026-01-19 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2511.15304 2026-01-19 cs.CL cs.AI 90%

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

对抗性诗歌作为大型语言模型中的通用单轮绕过机制

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Marcello Galisai, Vincenzo Suriani, Olga Sorokoletova, Federico Sartore, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马Sapienza大学) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校) VU Amsterdam(阿姆斯特丹VU)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 对抗性诗歌被证明能有效绕过大型语言模型的安全机制,其攻击成功率显著高于传统方法,揭示了现有安全措施的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15055 2026-01-19 cs.CL 89%

Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory

陷入基准?基于项目反应理论重新思考大语言模型基准测试

Hongli Zhou, Hui Huang, Ziqing Zhao, Lvyuan Han, Huicheng Wang, Kehai Chen, Muyun Yang, Wei Bao, Jian Dong, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出PSN-IRT框架,用于评估大语言模型基准的有效性,揭示现有基准的测量缺陷,并展示如何构建更符合人类偏好的小型基准。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08689 2026-01-19 cs.CL 88%

QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models

QuantEval:大型语言模型中金融量化任务的基准测试

Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin, Kehan Jiang, Zhicheng Fang, Yingjie He, Chunlei Meng, Rong Fu, Dongyang Chen, Leqi Zheng, Eric Hanchen Jiang, Yunfei Feng, Yitong Leng, Junfan Zhu, Xiaoyou Chen, Xi Yang, Richeng Xuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Macau(澳门大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) University of Chicago(芝加哥大学) Shanghai Weina Software Technology(上海韦纳软件技术) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 QuantEval是一个用于评估大型语言模型在金融量化任务中能力的基准测试,涵盖知识问答、数学推理和策略编程,通过回测框架评估模型性能,并展示了改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03543 2026-01-19 cs.CV cs.AI 88%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 88%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01386 2026-01-19 cs.LG 85%

ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs

ThinkEval: 基于思维的知识图谱对 LLM 编辑中知识泄漏的实用评估

Manit Baser, Dinil Mon Divakaran, Mohan Gurusamy

机构 * Electrical and Computer Engineering National University of Singapore(新加坡国立大学电子与计算机工程系) A*STAR Institute for Infocomm Research (A*STAR I 2 R), Singapore(新加坡A*STAR信息与通信研究机构)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ThinkEval通过构建专门知识图谱评估LLM编辑中的间接知识泄漏,揭示了现有编辑技术在平衡知识抑制与保留方面的不足。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11060 2026-01-19 cs.HC 85%

Children's Expectations, Engagement, and Evaluation of an LLM-enabled Spherical Visualization Platform in the Classroom

儿童的期望、参与度及对一个LLM增强的球形可视化平台在课堂中的评价

Emelie Fälton, Isabelle Strömstedt, Mathis Brossier, Andreas Göransson, Konrad Schönborn, Amy Loutfi, Erik Sunden, Mujtaba Fadhil Jawad, Yadgar Suleiman, Johanna Björklund, Mario Romero, Anders Ynnerman, Lonni Besançon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM增强的球形可视化平台在课堂中对小学生期望、参与度及评价的影响,通过实验揭示了该技术在教育中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07173 2026-01-19 cs.CL cs.AI cs.CV 84%

Better Language Models Exhibit Higher Visual Alignment

表现更佳的语言模型具有更高的视觉对齐性

Jona Ruthardt, Gertjan J. Burghouts, Serge Belongie, Yuki M. Asano

机构 * Fundamental AI Lab, University of Technology Nuremberg(技术基础人工智能实验室,不莱梅技术大学) Intelligent Imaging, TNO(智能成像,TNO) Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ShareLock 方法,通过融合冻结的视觉和语言模型骨干,提升视觉对齐能力,实现高效跨语言图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10820 2026-01-19 cs.LG cs.AI cs.CL cs.MA 82%

Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents

通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程

Himanshu Thakur, Anusha Kamath, Anurag Muthyala, Dhwani Sanmukhani, Smruthi Mukund, Jay Katukuri

机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) JPMorgan Chase & Co.(摩根大通公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10809 2026-01-19 cs.CL 81%

A Concise Agent is Less Expert: Revealing Side Effects of Using Style Features on Conversational Agents

简洁的代理不如专家:使用风格特征于对话代理时揭示副作用

Young-Min Cho, Yuan Yuan, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究揭示了在对话代理中使用风格特征时的副作用,指出不同风格特征之间存在深度交织,传统方法难以有效控制,需更原理化的多目标引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10748 2026-01-19 eess.SP cs.AI cs.LG 81%

AnyECG: Evolved ECG Foundation Model for Holistic Health Profiling

AnyECG:用于整体健康概况的进化ECG基础模型

Jun Li, Hongling Zhu, Yujie Xiao, Qinghao Zhao, Yalei Ke, Gongzheng Tang, Guangkun Nie, Deyun Zhang, Jin Li, Canqing Yu, Shenda Hong

机构 * National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Medical Technology, Health Science Center of Peking University(北京大学医学技术研究所) Department of Internal Medicine, Tongji Hospital, Tongji Medical College, Huazhong University of Science and Technology(同济大学同济医学院内科部) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) Department of Epidemiology and Biostatistics, School of Public Health, Peking University(北京大学公共卫生学院流行病与生物统计学系) Peking University Center for Public Health and Epidemic Preparedness & Response(北京大学公共卫生与突发卫生事件应对中心) Key Laboratory of Epidemiology of Major Diseases (Peking University), Ministry of Education(北京大学主要疾病流行病学重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) HeartVoice Medical Technology(心声医疗技术)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 AnyECG通过迁移学习构建基础模型,实现对多种疾病的系统预测和长期风险评估,提升整体健康概况能力。

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20004 2026-01-19 cs.LG cs.AI cs.CV 81%

Zero-Shot Transfer Capabilities of the Sundial Foundation Model for Leaf Area Index Forecasting

Sundial基础模型在叶面积指数预测中的零样本转移能力

Peining Zhang, Hongchen Qin, Haochen Zhang, Ziqi Guo, Guiling Wang, Jinbo Bi

机构 * Sundial Foundation(Sundial基金会)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Sundial基础模型在无需任务特定调优的情况下,能够超越专门监督模型,在遥感时间序列预测中展现强大零样本转移能力。

Comments 6 pages, 5 figures, AAAI 2026 AgriAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11286 2026-01-19 cs.AI 79%

XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making

XChoice: 用于基于LLM的受限选择决策中的可解释性AI-人类对齐评估

Weihong Qi, Fan Huang, Rasika Muralidharan, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 XChoice是一种用于评估基于LLM的受限选择决策中AI-人类对齐的可解释框架,通过机制模型恢复可解释参数以诊断不一致并支持改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11039 2026-01-19 cs.SD cs.CL 79%

SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models

SonicBench: 解剖大音频语言模型中的物理感知瓶颈

Yirong Sun, Yanjun Chen, Xin Qiu, Gang Zhang, Hongyu Chen, Daokuan Wu, Chengming Li, Min Yang, Dawei Zhu, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Amazon AGI(亚马逊人工智能)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 SonicBench通过评估大音频语言模型在物理属性感知上的能力,揭示其在基础听觉理解上的不足,指出瓶颈在于对齐和解码阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10835 2026-01-19 cs.CV cs.AI 79%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11574 2026-01-19 cs.CV 78%

Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis

通过多视角对应分析评估基础模型的3D理解

Valentina Lilova, Toyesh Chakravorty, Julian I. Bibo, Emma Boccaletti, Brandon Li, Lívia Baxová, Cees G. M. Snoek, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。

Comments NeurIPS 2025 UniReps workshop, to be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18488 2026-01-19 cs.SE cs.AI 77%

Evaluating perturbation robustness of generative systems that use COBOL code inputs

评估使用COBOL代码输入的生成系统对扰动的鲁棒性

Samuel Ackerman, Wesam Ibraheem, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出评估使用COBOL代码输入的生成系统鲁棒性的框架,通过扰动方法和可视化工具提升系统对输入变化的鲁棒性。

Comments 16 pages (8 main, 8 appendix). Accepted to AI-SQE (ICSE, 2026): The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG 75%

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11077 2026-01-19 cs.SE cs.AI cs.CL 73%

ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development

ABC-Bench: 评估现实世界开发中自主后端编码的基准测试

Jie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang, Zhiheng Xi, Shichun Liu, Yuxin Wang, Bo Wang, Yining Zheng, Tao Gui, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启济智风有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ABC-Bench是一个评估自主后端编码在真实可执行工作流中性能的基准测试,通过224个实际任务揭示了当前模型在复杂后端工程任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05611 2026-01-19 cs.CL cs.AI 73%

MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction

MADIAVE:多智能体辩论用于隐式属性值提取

Wei-Chieh Huang, Cornelia Caragea

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MADIAVE通过多智能体辩论框架提升隐式属性值提取的准确性和鲁棒性,适用于多模态电子商务场景。

Comments Accepted by EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11220 2026-01-19 cs.CL 70%

MultiCaption: Detecting disinformation using multilingual visual claims

多 caption:利用多语言视觉主张检测虚假信息

Rafael Martins Frade, Rrubaa Panchendrarajan, Arkaitz Zubiaga

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MultiCaption通过多语言视觉主张数据集提升多模态虚假信息检测性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14161 2026-01-19 cs.CL 70%

MIST: Towards Multi-dimensional Implicit BiaS Evaluation of LLMs for Theory of Mind

MIST:面向大语言模型理论思维的多维隐性偏见评估

Yanlin Li, Hao Liu, Huimin Liu, Kun Wang, Yinwei Wei, Yupeng Hu

机构 * School of Software(软件学院) Shandong University(山东大学) National University of Singapore(新加坡国立大学) School of Psychology(心理学学院) Hainan Normal University(海南师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MIST通过两个间接任务揭示大语言模型在理论思维方面的多维隐性偏见,提升模型对刻板印象的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00815 2026-01-19 cs.CL 70%

Chandomitra: Towards Generating Structured Sanskrit Poetry from Natural Language Inputs

Chandomitra:朝向从自然语言输入生成结构化梵文诗歌

Manoj Balaji Jagadeeshan, Samarth Bhatia, Pretam Ray, Harshul Raj Surana, Akhil Rajeev P, Priya Mishra, Annarao Kulkarni, Ganesh Ramakrishnan, Prathosh AP, Pawan Goyal

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Chandomitra通过约束解码和指令微调方法,实现了在低资源语言梵文中生成结构化诗歌的高语法准确性和语义连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18783 2026-01-19 cs.CL 70%

Are NLP Models Good at Tracing Thoughts: An Overview of Narrative Understanding

NLP模型是否擅长追踪思想:叙事理解综述

Lixing Zhu, Runcong Zhao, Lin Gui, Yulan He

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了叙事理解任务,探讨了其关键特征、定义、分类及评估方法,并提出通过扩展模块化LLMs能力来提升叙事理解的新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06404 2026-01-19 cs.CV 67%

InfoAffect: Affective Annotations of Infographics in Information Spread

InfoAffect: 信息传播中信息图的情感标注

Zihang Fu, Yunchao Wang, Chenyu Huang, Guodao Sun, Ronghua Liang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 InfoAffect数据集通过多模态大语言模型和递归排名融合算法,实现了信息图情感标注的高准确度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04521 2026-01-19 cs.LG cs.AI 62%

TSSR: Two-Stage Swap-Reward-Driven Reinforcement Learning for Character-Level SMILES Generation

TSSR:两阶段交换-奖励驱动强化学习用于字符级SMILES生成

Jacob Ede Levine, Yun Lyan Luo, Sai Chandra Kosaraju

机构 * Department of Computer Science, California State Polytechnic University, Pomona, CA, USA(计算机科学系,加州州立理工大学庞纳分校) Department of Biotechnology and Pharmaceutical Sciences, Western University of Health Sciences, Pomona, CA, USA(生物技术与药学科学系,西部健康科学大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 TSSR通过两阶段交换-奖励驱动强化学习提升字符级SMILES生成的语法和化学有效性,同时保持多样性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11514 2026-01-19 cs.CV cs.LG 57%

ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

ShapeR: 从随意捕获序列中生成鲁棒的条件3D形状

Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Henry Howard-Jenkins, Daniel DeTone, Pierre Moulon, Qirui Wu, Zhengqin Li, Julian Straub, Richard Newcombe, Jakob Engel

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 ShapeR通过整合视觉-惯性SLAM、3D检测和视觉-语言模型,从随意捕获的序列中生成鲁棒的条件3D形状,实验显示其在Chamfer距离上优于现有方法2.7倍。

Comments Project Page: http://facebookresearch.github.io/ShapeR Video: https://www.youtube.com/watch?v=EbY30KAA55I

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11488 2026-01-19 cs.CL cs.CV 57%

CTest-Metric: A Unified Framework to Assess Clinical Validity of Metrics for CT Report Generation

CTest-Metric:一个统一框架,用于评估CT报告生成中度量的临床有效性

Vanshali Sharma, Andrea Mia Bejar, Gorkem Durak, Ulas Bagci

机构 * Machine and Hybrid Intelligence Lab, Northwestern University, Chicago, IL, USA(机器与混合智能实验室,西北大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CTest-Metric通过三个模块评估CT报告生成中度量的临床有效性,发现GREEN Score与专家判断最一致,BERTScore-F1对事实性错误最不敏感。

Comments Accepted at ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 57%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05487 2026-01-19 cs.MA cs.AI 57%

EvidFuse: Writing-Time Evidence Learning for Consistent Text-Chart Data Reporting

EvidFuse: 为一致的文本-图表数据报告进行写作时的证据学习

Huanxiang Lin, Qianyue Wang, Jinwu Hu, Bailin Chen, Qing Du, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 EvidFuse通过多智能体框架实现写作时文本-图表交织生成,解决数据驱动报告中图表与文本不一致的问题,提升分析深度和证据空间扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏