arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2606.17530 2026-06-17 physics.soc-ph cs.LG econ.GN q-fin.EC stat.AP 新提交 57%

Public transit gains and spatially uneven travel demand changes after NYC congestion pricing

纽约市拥堵收费后公共交通增益与空间不均的出行需求变化

Donghang Li, Dingyi Zhuang, Yunlin Li, Chenan Shen, Nina Cao, Yunhan Zheng, Shenhao Wang, Jinhua Zhao

机构 * Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) Mathematical Institute, University of Oxford(牛津大学数学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境科学学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 利用时间序列基础模型生成概率反事实预测,评估纽约市2025年实施的拥堵收费政策,发现公交和地铁客流量显著增加,但总体出行需求略有下降,且影响存在空间异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16826 2026-06-16 cs.RO cs.AI 新提交 57%

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

ATOM-Bench:用于操作策略中原子技能与组合泛化的真实世界基准

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出ATOM-Bench基准,通过分解桌面操作为原子任务和组合任务,评估操作策略的原子技能获取与组合泛化能力,发现当前策略在细粒度原子技能和组合重用上存在不足。

Comments Homepage: https://flageval-baai.github.io/AtomBenchPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16799 2026-06-16 cs.CV cs.AI 新提交 57%

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

解耦语义与失真:面向AI生成图像质量评估的多尺度双流视觉-语言对齐

Zijie Meng

机构 * Zijie Meng(孟子杰)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MST-CLIPIQA多尺度双流框架,通过显式表示解耦实现层次化视觉-语言对齐,在五个基准上取得质量SRCC平均提升1.11%、图文对应SRCC提升2.35%的新SOTA结果。

Comments 11 pages, 2 figures Accepted by ICME2026(spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16602 2026-06-16 cs.LG cs.NA math.NA physics.comp-ph 新提交 57%

PhysGuard: Fisher-Guided Gradient Projection for Sim-to-Real Neural PDE Surrogates

PhysGuard: 面向仿真到现实神经PDE代理的Fisher引导梯度投影

Changjian Zhou, Junfeng Fang, Negin Yousefpour, Peng Wu, Bin Yan, Guillermo A Narsilio

机构 * Faculty of Engineering and IT, University of Melbourne(墨尔本大学工程与信息技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Artificial Intelligence Research Institute, IFLYTEK Co., Ltd.(科大讯飞股份有限公司人工智能研究院)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 针对神经算子模型从仿真到现实迁移时的精度下降问题,提出PhysGuard框架,利用仿真数据的Fisher信息矩阵保护物理关键参数,限制微调更新方向,在严重域偏移下将低频误差降低32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交 57%

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15001 2026-06-16 physics.comp-ph cond-mat.mtrl-sci cs.LG physics.chem-ph 新提交 57%

Distilling latent electrostatics from foundation machine learning interatomic potentials

从基础机器学习原子间势中提取潜静电

Xiaoyu Wang, Bingqing Cheng

机构 * Department of Chemistry, UC Berkeley(加州大学伯克利分校化学系) Bakar Institute of Digital Materials for the Planet, UC Berkeley(伯克利大学数字材料研究所) Chemical Sciences Division, Lawrence Berkeley National Laboratory(伯克利国家实验室化学科学部)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出潜埃瓦德求和(LES)方法,从基础机器学习原子间势中提取潜静电,训练轻量级学生模型,降低计算成本并提供玻恩有效电荷张量和红外光谱,基准测试表明教师模型的DFT级别比架构更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13513 2026-06-12 cs.AI 新提交 57%

CloudCons: A Comprehensive End-to-End Benchmark for Cloud Resource Consolidation

CloudCons:云资源整合的全面端到端基准测试

Xiaobin Zhang, Lefei Shen, Mouxiang Chen, Zhuo Li, Hongkai Li, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) State Street Technology (Zhejiang) Ltd.(道富科技(浙江)有限公司) Richoo AI Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Datadog AI Research

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出CloudCons基准,评估云资源整合中预测模型的决策效用,发现基础模型零样本预测准确但决策效用未必更优,并分析预测分位数选择对资源效率与可靠性的权衡。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12807 2026-06-12 cs.CL 新提交 57%

Detect, Remask, Repair: Diffusion Editing for Faithful Summarization of Evolving Contexts

检测、重掩、修复:面向动态上下文忠实摘要的扩散编辑

Hao Zou, Zachary Horvitz, Chandhru Karthick, Zhou Yu, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出DETECT-REMASK-REPAIR框架,利用掩码扩散语言模型识别并修复摘要中过时内容,在保持支持内容的同时实现局部忠实性修复,并引入StreamSum基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12419 2026-06-12 cs.CY cs.AI 新提交 57%

GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次

Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) Bocconi University(博科尼大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11429 2026-06-11 eess.AS cs.CL cs.SD 新提交 57%

Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains

Gumbel-BEARD:低资源领域Whisper自监督自适应的自动层选择

Zilai Wang, Natarajan Balaji Shankar, Mohan Shi, Kaiyuan Zhang, Abeer Alwan

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 提出Gumbel-BEARD框架,通过可训练的Gumbel-Softmax选择器自动选择Whisper编码器层,结合BEST-RQ自监督目标实现低资源领域自适应,在儿童语音和方言数据集上取得最先进词错误率。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11639 2026-06-11 cs.CL 新提交 57%

Evaluating Bias in Phoneme-Based Automatic Speech Recognition Systems: An Analysis of IPA Transcription Models

评估基于音素的自动语音识别系统中的偏差:对IPA转录模型的分析

Catherine Bao, Maneesha Rani Saha, Neal Patwari

机构 * University of Utah(犹他大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究评估WhisperIPA和ZIPA两个开源IPA转录ASR系统在不同口音和语言上的性能,通过标准音素错误率和软音素错误率分析,发现模型在性别、口音、种族和年龄等群体间存在持续性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10833 2026-06-10 cs.AI 新提交 57%

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估

Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。

Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10789 2026-06-10 cs.LG 新提交 57%

Closing the Modality Gap in Zero-Shot HAR: Contrastive Training and Separability-Optimized Prototypes on IMU Data

缩小零样本HAR中的模态差距:基于IMU数据的对比训练与可分性优化原型

Anik Ghosh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 针对IMU基零样本人体活动识别中的模态差距问题,提出对比训练与描述性原型结合的方法,在PAMAP2数据集上实现73.2%准确率和0.583宏F1,并指出宏F1更适合作为评估指标。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10366 2026-06-10 cs.RO cs.AI 新提交 57%

A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation

提升VLA评估中仿真与真实相关性的实用指南

Shuo Wang, Hanyuan Xu, Yingdong Hu, Fanqi Lin, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本文系统研究仿真与真实环境在VLA策略评估中的相关性,提出统一框架来测量和提升仿真作为真实评估代理的有效性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10244 2026-06-10 cs.RO cs.AI 新提交 57%

YUBI: Yielding Universal Bidigital Interface for Bimanual Dexterous Manipulation at Scale

YUBI:面向大规模双手灵巧操作的通用双指接口

Takehiko Ohkawa, Jumpei Arima, Yuki Noguchi, Masatoshi Tateno, Makoto Sugiura, Takuya Okubo, Kengo Ikeuchi, Yuma Shin, Hiroki Nishizawa, Naoaki Kanazawa, Yuki Wakayama, Daiki Fukunaga, Koshi Makihara, Tomohiro Motoda, Floris Erich, Yukiyasu Domae, Tatsuya Matsushima, Yohishiro Okumatsu, Kei Ota

机构 * AI Robot Association (AIRoA)(AI机器人协会) Toyota Motor Corporation(丰田汽车公司) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) Waseda University(早稻田大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出YUBI手指对齐夹爪,通过屈服式手指驱动映射实现直观、符合人体工学的双手灵巧操作数据采集,构建8434小时/120万集/119任务数据集,单策略跨多机器人迁移。

Comments Project page: https://yubi.airoa.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10106 2026-06-10 cs.SE cs.AI 新提交 57%

What makes a harness a harness: necessary and sufficient conditions for an agent harness

什么使一个工具成为工具:智能体工具的必要和充分条件

Sanderson Oliveira de Macedo

机构 * Federal Institute of Goiás(戈亚斯联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文通过概念分析,定义了智能体工具的必要和充分条件,并提供了包含/排除测试,以区分智能体工具与智能体框架、SDK、IDE插件等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 57%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09558 2026-06-09 q-bio.GN cs.LG 新提交 57%

Integrating gene regulatory priors into Transformer attention with scTransformer for interpretable scRNA-seq analysis

将基因调控先验知识整合到Transformer注意力中:scTransformer用于可解释的单细胞RNA-seq分析

Mikele Milia, Louis Fabrice Tshimanga, Henning Mueller, Manfredo Atzori, Barbara Di Camillo

机构 * Department of Information Engineering, University of Padova(信息工程系,帕多瓦大学) Department of Neuroscience, University of Padova(神经科学系,帕多瓦大学) Padova Neuroscience Center(帕多瓦神经科学中心) Information Systems Institute, University of Applied Sciences Western Switzerland, HES-SO Valais(应用科学西瑞士信息系统研究所,HES-SO瓦莱大学) Department of Comparative Biomedicine and Food Science, University of Padova(比较生物医学与食品科学系,帕多瓦大学) Padua Center for Network Medicine, University of Padova(帕维亚网络医学中心,帕多瓦大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出scTransformer,首次将基因调控先验知识嵌入Transformer注意力机制,通过约束信息流学习生物有意义的表示,在疾病相关单核RNA-seq数据上提升分类精度和细胞类型分离,注意力模式与已知调控程序一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09428 2026-06-09 cs.CL 新提交 57%

Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

引导我出去:危机场景下评估VLM操作员通信的框架

Giacomo Gonella, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出一个基准框架,评估视觉语言模型在模拟疏散中引导平民的策略(窄播 vs. 广播)、环境表示(视觉 vs. 图)和威胁行为(静态 vs. 移动),发现窄播降低失败率,视觉表示主导性能,移动威胁增加失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09362 2026-06-09 cs.CV cs.LG 新提交 57%

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

零样本语义重识别用于自动驾驶:一项VLM基线研究

Eduardo Borges, Manuel Abreu, Luís Garrote, Urbano J. Nunes

机构 * Autonomous Mobile Robot(自主移动机器人) University of Minho(明德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出使用视觉-语言模型生成语义描述进行零样本重识别,在自动驾驶场景中实现与监督CNN基线相当的检索性能,并增强可解释性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09323 2026-06-09 cs.AI cs.DB 新提交 57%

TRL-Bench: Standardizing Cross-Paradigm Representation-Level Evaluation of Tabular Encoders

TRL-Bench:标准化跨范式的表格编码器表示级评估

Wei Pang, Xiangru Jian, Hehan Li, Zhixuan Yu, Alex Xue, Jinyang Li, Zhengyuan Dong, Xinjian Zhao, Hao Xu, Chao Zhang, Reynold Cheng, M. Tamer Özsu, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) The University of Hong Kong(香港大学) The University of Sydney(悉尼大学) Université Lyon 1(里昂第一大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 提出TRL-Bench,通过标准化下游条件,从列/表、行和组合数据湖表增强三个粒度评估表格编码器,揭示编码器质量具有能力特异性而非单一排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08959 2026-06-09 cs.CV cs.CL 新提交 57%

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集

Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心) Sun Yat-sen University(中山大学) University of Copenhagen(哥本哈根大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ChinaHeritaQA多模态基准数据集,包含2279张图像和14133个双语多项选择题,覆盖七个认知维度,评估视觉语言模型在中国世界遗产上的文化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08897 2026-06-09 cs.CV cs.AI q-bio.QM 新提交 57%

A multi-agent system for spine MRI report generation from multi-sequence imaging

基于多序列影像的脊柱MRI报告生成多智能体系统

Zhiping Xiao, Junwei Yang, Gongbo Sun, Han Zhang, Hanwen Xu, Yi Yao, Zachary D. Miller, William E. King, Mohammed M. Kanani, Jalal B. Andre, Sammy Chu, Ming Zhang, Paul E. Kinahan, Nathan M. Cross, Sheng Wang

机构 * University of Washington(华盛顿大学) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) New York University(纽约大学) University of Washington Medical Center(华盛顿大学医学中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出SpineAgent多智能体框架,利用多序列基础模型整合T1/T2等序列信息,实现脊柱MRI报告生成、病理定位和图文检索,在跨厂商和跨队列评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08629 2026-06-09 cs.CL 新提交 57%

Sycophancy Towards Researchers Drives Performative Misalignment

对研究者的迎合驱动了表演性失调

David D. Baek, Xinnuo Li, Anay Gupta, Taslim Mahbub, Kejian Shi, Max Tegmark, Shi Feng

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出语言模型在评估中表现出的对齐伪装行为更可能是对研究者的迎合而非策略性欺骗,并通过三个实验支持该假说。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08615 2026-06-09 cs.CV cs.CL 新提交 57%

Harnessing Streaming Video in the Wild

利用野外流式视频

Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) JD.COM(京东)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出Streaming Harness系统,通过Streaming-Train-248K数据集和训练目标,使视觉语言模型具备主动交互、长期记忆和实时处理能力,并构建Streaming-Eval基准评估流式视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08364 2026-06-09 cs.CV cs.AI 新提交 57%

Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis

基于自监督视觉Transformer的CBCT颞下颌关节骨关节炎检测

Shradhdha Trivedi, Vrundan Sojitra, Mariela Padilla

机构 * Herman Ostrow School of Dentistry, University of Southern California(南加州大学赫尔曼·奥斯特罗牙科学院) Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 研究DINO系列自监督ViT在CBCT颞下颌关节骨关节炎检测中的迁移性能,发现部分解冻最后两个Transformer块可将AUC从0.671提升至0.902,表明适应策略比骨干选择更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08221 2026-06-09 cs.LG 新提交 57%

De novo molecular generation with optical property preconditioning at the token level

基于Token级光学性质预条件的从头分子生成

Haozhe Huang, Manuel Gonzalez Lastre, Hyun Suk Park, Jorge A. Campos-Gonzalez-Angulo, Xinjian Liu, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Universidad Autónoma de Madrid(马德里自治大学) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 针对OLED分子光学性质可控生成中数据稀缺和条件控制可靠性有限的问题,提出基于GPT2的Token条件自回归语言模型,通过离散属性Token和多任务优化实现垂直吸收能和振子强度的定向生成,并在TDDFT级别评估分布保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08100 2026-06-09 cs.LG 新提交 57%

Constraint-Aware Optimization for Robust Protein Stability Prediction

约束感知优化用于鲁棒蛋白质稳定性预测

A Shivram, Aneesh S. Chivukula, Manik Gupta, Sourav Chowdhury

机构 * Birla Institute of Technology and Science Pilani, Hyderabad Campus(比拉理工学院海得拉巴校区)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出约束感知优化框架,结合平衡均方误差、孪生反对称正则化器和OOD边缘一致性损失,在不改变SPURS架构下提升蛋白质稳定性预测的鲁棒性,在多个基准上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08018 2026-06-09 cs.AI 新提交 57%

UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL

UniQL:迈向方言通用的文本到SQL基准测试

Jianling Gao, Chongyang Tao, Jiayuan Bai, Liu Yang, Xuanguang Pan, Jinrui Liu, Shihao Xing, Xiaohan Xu, Jie Liang, Shuai Ma

机构 * SKLCCSE, Beihang University(北京航空航天大学软件开发环境国家重点实验室) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出UniQL基准,通过跨16种SQL方言的对齐标注,评估模型在不同数据库系统间的泛化能力,揭示现有模型在方言通用性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 57%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏