arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 103 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 103 篇

2601.22636 2026-02-10 cs.AI 90%

Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling

在最佳-N采样下对大语言模型中的对抗风险进行统计估计

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Chenliang Xu, Christopher White, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出SABER方法,通过Beta分布建模样本成功概率,利用解析缩放定律预测大规模对抗风险,显著降低估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08266 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.IR 90%

Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants

对殖民弗吉尼亚土地授予进行大规模语言模型评估

Ryan Mioduski

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了大规模语言模型在将殖民弗吉尼亚土地授予描述转换为地理坐标方面的性能,发现模型在准确性与成本效益上表现优异。

Journal ref Journal of Spatial Information Science, No. 31 (2025), pp. 57-96

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07904 2026-02-10 cs.LG cs.AI 90%

Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models

基于大语言模型的贝叶斯优化自适应获取选择

Giang Ngo, Dat Phan Trong, Dang Nguyen, Sunil Gupta, Svetha Venkatesh

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(德肯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LMABO框架,利用预训练大语言模型作为自适应策略,通过结构化状态表示选择最优获取函数,提升贝叶斯优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11090 2026-02-10 cs.CL cs.AI 90%

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

SafeDialBench: 一种用于多轮对话中大型语言模型安全评估的细粒度基准,针对多样化对抗攻击

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tianpei Yang, Jing Huo, Yang Gao, Fanyu Meng, Xi Yang, Chao Deng, Junlan Feng

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Research Institute(中国移动研究院) China Mobile (Suzhou) Software Technology Co., Ltd(中国移动苏州软件技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SafeDialBench提出了一种细粒度基准,用于评估大型语言模型在多轮对话中面对多样化对抗攻击时的安全性,通过多维度分类和对抗攻击策略提升评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12144 2026-02-10 cs.CL cs.AI 90%

Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models

基于大语言模型的人格情境判断测试自动题目生成

Chang-Jin Li, Jiyuan Zhang, Yun Tang, Jian Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型开发自动生成人格情境判断测试的框架,通过三项实验验证了其在内容效度、可重复性和心理测量特性上的有效性。

Comments Accepted by Computers in Human Behavior Reports. The supplementary materials, data, and items are available at https://osf.io/jbvq7/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 90%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08889 2026-02-10 cs.AI 89%

Scalable Delphi: Large Language Models for Structured Risk Estimation

可扩展的德尔菲:用于结构化风险估计的大型语言模型

Tobias Lorenz, Mario Fritz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出可扩展的德尔菲方法,利用大型语言模型进行结构化风险评估,通过多样化的专家人设和迭代优化,实现了高效且准确的风险估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08887 2026-02-10 cs.SE cs.AI 89%

DeepQuali: Initial results of a study on the use of large language models for assessing the quality of user stories

DeepQuali: 大型语言模型在评估用户故事质量研究中的初步结果

Adam Trendowicz, Daniel Seifert, Andreas Jedlitschka, Marcus Ciolkowski, Anton Strahilov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DeepQuali利用大型语言模型评估用户故事质量,通过对比专家判断发现其在整体评估上有效,但细节评分存在分歧,且需进一步融入工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 89%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08192 2026-02-10 cs.SE 89%

Adoption of Large Language Models in Scrum Management: Insights from Brazilian Practitioners

大语言模型在Scrum管理中的应用:来自巴西实践者的洞察

Mirko Perkusich, Danyllo Albuquerque, Allysson Allex Araújo, Matheus Paixão, Rohit Gheyi, Marcos Kalinowski, Angelo Perkusich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了大语言模型在Scrum管理中的应用,发现其在提升生产率和减少手动工作方面有显著益处,但同时也面临输出准确性和保密性等风险。

Comments Accepted for publication at the 27th International Conference on Agile Software Development (XP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03444 2026-02-10 cs.CL cs.AI 88%

Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties

大语言模型的税收视角:关于附加税收罚金的案例研究

Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh, Juheon Kang, Won Hur, Hun Park, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。

Comments 9 pages

Journal ref EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG 88%

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07079 2026-02-10 cs.SE cs.CL 88%

Comprehensive Evaluation of Large Language Models on Software Engineering Tasks: A Multi-Task Benchmark

对大型语言模型在软件工程任务中的综合评估:一个多任务基准测试

Go Frendi Gunawan, Mukhlis Amien

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了11种先进LLMs在五个软件工程任务中的表现,发现模型在完成时间、工具效率和成本上存在显著差异,同时揭示了两种低效模式,并展示了编码任务的成功率与研究任务的挑战性差异。

Comments 10 pages, 7 figures. Under review. Code and data will be fully released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11341 2026-02-10 cs.CV 88%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01474 2026-02-10 cs.AI 87%

AIReg-Bench: Benchmarking Language Models That Assess AI Regulation Compliance

AIReg-Bench: 用于评估AI监管合规性的语言模型基准测试

Bill Marino, Rosco Hunter, Christoph Schnabl, Zubair Jamali, Marinos Emmanouil Kalpakos, Mudra Kashyap, Isaiah Hinton, Alexa Hanson, Maahum Nazir, Felix Steffek, Hongkai Wen, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Warwick(沃里克大学) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 AIReg-Bench是一个用于评估语言模型在AI监管合规性评估方面性能的基准数据集,通过生成虚构AI系统样本并由法律专家标注,为LLM的合规性评估提供测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07238 2026-02-10 cs.AI cs.LG econ.GN q-fin.EC 87%

Is there "Secret Sauce'' in Large Language Model Development?

大型语言模型开发中是否存在'秘密配方'?

Matthias Mertens, Natalia Fischl-Lanzoni, Neil Thompson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大型语言模型的前沿进展主要由计算量驱动,而非专有技术,但非前沿领域中专有技术可显著降低计算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 87%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07275 2026-02-10 cs.NE 87%

Evolving LLM-Derived Control Policies for Residential EV Charging and Vehicle-to-Grid Energy Optimization

进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化

Vishesh Purnananda, Benjamin John Wruck, Mingyu Guo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG 87%

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08003 2026-02-10 cs.LG cs.AI cs.DC cs.IT math.IT stat.ML 86%

Don't Always Pick the Highest-Performing Model: An Information Theoretic View of LLM Ensemble Selection

不要总是选择表现最好的模型:对大语言模型集成选择的信息论视角

Yigit Turkmen, Baturalp Buyukates, Melih Bastopcu

机构 * Department of Electrical and Electronics Engineering, Bilkent University, Ankara, Turkey(电气与电子工程系,比尔肯大学,安卡拉,土耳其) School of Computer Science, University of Birmingham, Birmingham, UK(计算机科学学院,伯明翰大学,伯明翰,英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于信息论的集成选择算法,通过最大化互信息来选择模型,以提高集成性能并避免性能饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08896 2026-02-10 cs.IR cs.AI 85%

OmniReview: A Large-scale Benchmark and LLM-enhanced Framework for Realistic Reviewer Recommendation

OmniReview: 一个大规模基准和基于LLM的框架,用于现实中的审稿人推荐

Yehua Huang, Penglei Sun, Zebin Chen, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniReview提出了一种基于LLM和多任务学习的框架,通过整合多源数据构建大规模基准,实现更精确的审稿人推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08253 2026-02-10 cs.AI 85%

G-LNS: Generative Large Neighborhood Search for LLM-Based Automatic Heuristic Design

G-LNS:基于生成式大邻域搜索的LLM自动启发式设计

Baoyun Zhao, He Wang, Liang Zeng

机构 * Software College, Northeastern University(东北大学软件学院) International Centre for Theoretical Physics Asia-Pacific, University of Chinese Academy of Sciences(中国科学院大学国际理论物理亚太中心) Taiji Laboratory for Gravitational Wave Universe, University of Chinese Academy of Sciences(中国科学院大学太极引力波宇宙实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 G-LNS通过生成式进化框架,结合LLM共同进化破坏与修复操作符,实现了大邻域搜索操作符的自动化设计,在复杂组合优化问题中表现出更强的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05842 2026-02-10 cs.CL 85%

Reinforcement World Model Learning for LLM-based Agents

基于强化学习的世界模型学习用于基于大语言模型的智能体

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath, Nikhil Singh, Jiangfeng Gao, Zhou Yu

机构 * Columbia University, New York(哥伦比亚大学) Microsoft Research, Redmond(微软研究院) Dartmouth College, Hanover(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的世界模型学习方法,用于提升基于大语言模型的智能体在环境动态适应和预测方面的性能。

Comments fixed Nikhil Singh's affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22896 2026-02-10 cs.AI 85%

Game-Theoretic Co-Evolution for LLM-Based Heuristic Discovery

基于博弈论的LLM启发式发现共演化

Xinyi Ke, Kai Li, Junliang Xing, Yifan Zhang, Jian Cheng

机构 * C2DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASRO框架,通过博弈论方法实现求解器与实例生成器的共演化,提升启发式发现的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07996 2026-02-10 cs.CL 85%

The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation

从不承认的裁判:基于大语言模型的评估中的隐藏捷径

Arash Marioriyad, Omid Ghahroodi, Ehsaneddin Asgari, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙菲大学技术学院) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了基于大语言模型的评估中隐藏的捷径问题,指出裁判模型在面对注入提示时缺乏透明度,导致裁决偏移率高但提示识别率低,揭示了评估流程中的可靠性缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07673 2026-02-10 cs.CL 85%

Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation

无人类触感:基于LLM的摘要评估中的重叠偏差

Jiangnan Fang, Cheng-Tse Liu, Hanieh Deilamsalehy, Nesreen K. Ahmed, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究发现LLM在摘要评估中对重叠度敏感,随着重叠减少,LLM更倾向于选择其他LLM生成的摘要,表明需采用更复杂的评判技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07733 2026-02-10 cs.AI 85%

SurveyG: A Multi-Agent LLM Framework with Hierarchical Citation Graph for Automated Survey Generation

SurveyG: 一种基于分层引用图的多智能体LLM框架用于自动化综述生成

Minh-Anh Nguye, Minh-Duc Nguyen, Ha Lan N. T., Kieu Hai Dang, Nguyen Tien Dong, Dung D. Le

机构 * CMC OpenAI, VinUniversity(CMC OpenAI与 VinUniversity) VinUniversity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SurveyG通过分层引用图和多智能体验证生成结构化的综述,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17834 2026-02-10 cs.CV 85%

Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography

从多模态数据集构建通用基础模型用于三维计算机断层扫描

Ibrahim Ethem Hamamci, Sezgin Er, Chenyu Wang, Furkan Almas, Ayse Gulnihan Simsek, Sevval Nil Esirgun, Irem Dogan, Omer Faruk Durugol, Benjamin Hou, Suprosanna Shit, Weicheng Dai, Murong Xu, Hadrien Reynaud, Muhammed Furkan Dasdelen, Bastian Wittmann, Tamaz Amiranashvili, Enis Simsar, Mehmet Simsar, Emine Bensu Erdemir, Abdullah Alanbay, Anjany Sekuboyina, Berkan Lafci, Ahmet Kaplan, Zhiyong Lu, Malgorzata Polacin, Bernhard Kainz, Christian Bluethgen, Kayhan Batmanghelich, Mehmet Kemal Ozdemir, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Division of Intramural Research, National Institutes of Health(美国国立卫生研究院内部研究部) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射学研究所) Department Artificial Intelligence in Biomedical Engineering, FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡工业大学生物医学工程人工智能系)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CT-RATE数据集及CT-CLIP和CT-CHAT模型,用于三维医学影像的通用基础模型研究,提升了多异常检测和病例检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06998 2026-02-10 cs.CY 85%

Tokenizations for Austronesian Language Models: study on languages in Indonesia Archipelago

印尼群岛语言模型的分词:对印尼群岛地区语言的研究

Andhika Bernard Lumbantobing, Hokky Situngkir

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本研究提出基于音节的分词方法,用于印尼群岛地区语言,通过音节分割和传统印尼文字原则,提升多语言LLM的语音和形态模式保留能力。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03152 2026-02-10 cs.CL cs.AI cs.LG 85%

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

MedVAL: 向语言模型的专家级医学文本验证迈进

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, Andrew Johnston, Karimar Amador-Martinez, Eduardo Juan Perez Guerrero, Paola Naovi Cruz Rivera, Sergios Gatidis, Christian Bluethgen, Eduardo Pontes Reis, Eddy D. Zandee van Rilland, Poonam Laxmappa Hosamani, Kevin R Keet, Minjoung Go, Evelyn Ling, David B. Larson, Curtis Langlotz, Roxana Daneshjou, Jason Hom, Sanmi Koyejo, Emily Alsentzer, Akshay S. Chaudhari

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MedVAL通过自监督蒸馏方法,利用合成数据提升语言模型在医学文本验证中的性能,达到专家级别。

详情

展开后加载摘要…

URL PDF HTML 收藏