arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2601.13770 2026-01-21 cs.AI cs.CL cs.LG q-fin.CP q-fin.GN 75%

Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance

Look-Ahead-Bench: 一个用于评估点即时大型语言模型在金融领域中前瞻性偏差的标准基准

Mostapha Benhenda

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Look-Ahead-Bench通过评估点即时LLMs在金融领域中的前瞻性偏差,揭示了标准LLMs的显著偏差问题,并为标准化评估提供了实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13139 2026-01-21 cs.SE 75%

From Human to Machine Refactoring: Assessing GPT-4's Impact on Python Class Quality and Readability

从人类到机器重构:评估GPT-4对Python类质量和可读性的影响

Alessandro Midolo, Emiliano Tramontana, Massimiliano Di Penta

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文评估GPT-4在Python类重构中的效果,发现其能提升代码质量和减少异味,但可能降低可读性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11874 2026-01-21 cs.IR 75%

Cultural Analytics for Good: Building Inclusive Evaluation Frameworks for Historical IR

为良好文化分析:构建包容性评估框架用于历史信息检索

Suchana Datta, Dwaipayan Roy, Derek Greene, Gerardine Meaney, Karen Wade, Philipp Mayr

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于文化分析和信息检索的包容性评估框架,通过构建历史文献的基准,提升数字档案馆的检索准确性与文化包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 75%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13142 2026-01-21 cs.CV cs.AI cs.CL 73%

TVWorld: Foundations for Remote-Control TV Agents

TVWorld: 电视遥控的基石

Zhantao Ma, Quanfeng Lu, Shuai Zhong, Dahai Yu, Ping Luo, Michael K. Ng

机构 * The University of Hong Kong(香港大学) Hong Kong Baptist University(香港 Baptist 大学) TCL Corporate Research (Hong Kong) Co., Ltd(TCL 香港企业研究有限公司)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 TVWorld提出了一种基于图的电视导航抽象,开发了TVWorld-N和TVWorld-G两个基准测试,通过拓扑感知训练框架TVTheseus实现了68.3%的成功率,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08545 2026-01-21 cs.AI cs.CL cs.SE 73%

Learner-Tailored Program Repair: A Solution Generator with Iterative Edit-Driven Retrieval Enhancement

面向学习者的程序修复:一种具有迭代编辑驱动检索增强的解决方案生成器

Zhenlong Dai, Zhuoluo Zhao, Hengning Wang, Xiu Tang, Sai Wu, Chang Yao, Zhipeng Gao, Jingyuan Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向学习者的程序修复任务及LSGEN框架,通过迭代编辑驱动检索增强方法提升程序修复效果,实验验证其在编程辅导中的有效性。

Comments Accepted by AAAI2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20941 2026-01-21 cs.CL cs.AI 73%

Do LLMs Truly Understand When a Precedent Is Overruled?

大型语言模型真的能理解当先例被推翻时的情况吗?

Li Zhang, Jaromir Savelka, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过评估LLMs在识别美国最高法院案件中推翻关系的能力,揭示了模型在时间敏感性、推理深度和上下文依赖性方面的局限性,并提出了一种更贴近真实法律推理任务的长上下文基准。

Comments 12 pages, 2 figures, JURIX 2025

Journal ref Proceedings of the 2025 Conference on Legal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21092 2026-01-21 cs.CL cs.AI 73%

BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge

BLUCK:一种用于孟加拉语语言理解和文化知识的基准数据集

Daeen Kabir, Minhajur Rahman Chowdhury Mahim, Sheikh Shafayat, Adnan Sadik, Arian Ahmed, Eunsu Kim, Alice Oh

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BLUCK是一个用于评估大型语言模型在孟加拉语语言理解和文化知识方面性能的基准数据集,包含2366个多选题,涵盖23个类别,揭示了孟加拉语作为中等资源语言的地位。

Comments Accepted at BLP Workshop, IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11863 2026-01-21 cs.IR cs.AI cs.CE cs.CL 73%

Utilizing Metadata for Better Retrieval-Augmented Generation

利用元数据提升检索增强生成

Raquib Bin Yousuf, Shengzhe Xu, Mandar Sharma, Andrew Neeser, Chris Latimer, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出元数据感知的检索策略,通过融合元数据与内容提升检索增强生成的效果,实验表明统一嵌入优于纯文本基线。

Comments The 48th European Conference on Information Retrieval (ECIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23779 2026-01-21 cs.CR cs.AI cs.LG 73%

Prompt-Induced Over-Generation as Denial-of-Service: A Black-Box Attack-Side Benchmark

提示诱导的过度生成作为拒绝服务:一种黑盒攻击侧基准

Manu, Yi Guo, Kanchana Thilakarathna, Nirhoshan Sivaroopan, Jo Plested, Tim Lynar, Jack Yang, Wangli Yang

机构 * Western Sydney University(西悉尼大学) The University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学) University of Wollongong(沃尔灵龙大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究提出两种基于提示的攻击方法,通过过度生成引发拒绝服务攻击,并引入过度生成因子评估攻击效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14188 2026-01-21 cs.CV 71%

IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models

IIR-VLM:面向大视觉-语言模型的上下文实例识别

Liang Shi, Wei Li, Kevin M Beussman, Lin Chen, Yun Fu

机构 * Northeastern University(东北大学) Wyze Labs, Inc.(Wyze实验室)

专题命中 评测与基准 :language model(title)

AI总结 IIR-VLM通过整合预训练的ILR专家模型,提升大视觉-语言模型在上下文实例识别中的性能,有效解决细粒度辨别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13264 2026-01-21 cs.CL 70%

Unlearning in LLMs: Methods, Evaluation, and Open Challenges

在大语言模型中进行反学习:方法、评估与开放挑战

Tyler Lizzo, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型中反学习的方法、评估体系及开放挑战,旨在为开发可靠且负责任的反学习技术提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21536 2026-01-21 cs.CL 70%

Construction and educational application of a linguistically grounded dependency treebank for Uyghur

构建并应用于乌兹别克语的语义基础依存树库

Jiaxin Zuo, Yiquan Wang, Yuan Pan, Xiadiya Yibulayin

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建了乌兹别克语语义基础依存树库,通过混合标注流程提高依存项目性,并开发AI辅助语法教学系统,验证其在提升非母语学习者句法理解能力方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12680 2026-01-21 cs.LG 70%

MetaToolAgent: Towards Generalizable Tool Usage in LLMs through Meta-Learning

MetaToolAgent:通过元学习实现LLM中通用工具使用的迈进

Zheng Fang, Wolfgang Mayer, Zeyu Zhang, Jian Wang, Hong-Yu Zhang, Wanli Li, Zaiwen Feng

机构 * College of Informatics, Huazhong Agricultural University(华中农业大学信息学院) Industrial AI Research Centre, University of South Australia(南澳大利亚大学工业AI研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MetaToolAgent通过元学习方法提升LLM在多样工具中的泛化能力,解决现有工具选择方法在实际部署中泛化能力不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12661 2026-01-21 cs.AI 70%

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

MedConsultBench: 一个完整周期、细粒度、过程感知的医疗咨询代理基准

Chuhan Qiao, Jianghua Huang, Daxing Zhao, Ziding Liu, Yanjun Shen, Bing Cheng, Wei Lin, Kai Wu

机构 * Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MedConsultBench通过细粒度过程感知评估医疗咨询代理的完整咨询周期,揭示高诊断准确性背后的效率与安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 70%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10462 2026-01-21 cs.AI cs.CV 70%

ChartComplete: A Taxonomy-based Inclusive Chart Dataset

ChartComplete: 基于分类的包容性图表数据集

Ahmad Mustapha, Charbel Toumieh, Mariette Awad

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。

Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09478 2026-01-21 cs.IR cs.AI 70%

Bridging Semantic Understanding and Popularity Bias with LLMs

通过大语言模型弥合语义理解和流行偏见之间的鸿沟

Renqiang Luo, Dong Zhang, Yupeng Gao, Wen Shi, Mingliang Hou, Jiaying Liu, Zhe Wang, Shuo Yu

机构 * Jilin University Changchun China Dalian University of Technology Dalian China Jinan University \& TAL Education Group Guangzhou China Jilin University Dalian University of Technology Jinan University \& TAL Education Group

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FairLRM框架,通过大语言模型增强对流行偏见的语义理解,提升推荐系统的公平性和准确性。

Comments 10 pages, 4 figs, WWW 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09208 2026-01-21 cs.HC cs.AI 70%

Mikasa: A Character-Driven Emotional AI Companion Inspired by Japanese Oshi Culture

Mikasa:受日本Oshi文化启发的以角色驱动的情感AI伴侣

Miki Ueno

机构 * The Kyoto College of Graduate Studies for Informatics(京都大学研究生信息学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mikasa通过稳定角色和明确关系定义,展示角色驱动设计在情感AI伴侣中的功能性。

Comments This version includes minor explanatory additions in Appendix B-D, Section 2.6, and selected footnotes. A short demonstration video link is also provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08341 2026-01-21 cs.AI cs.MA q-bio.GN 70%

Benchmarking AI scientists for omics data driven biological discovery

对驱动生物发现的生物信息学数据的AI科学家进行基准测试

Erpai Luo, Jinmeng Jia, Yifan Xiong, Xiangyu Li, Xiaobo Guo, Baoqi Yu, Minsheng Hao, Lei Wei, Xuegong Zhang

机构 * MOE Key Laboratory of Bioinformatics(生物信息学国家重点实验室) Bioinformatics Division of BNRIST, Department of Automation(生物信息学部) Tsinghua University(清华大学) School of Software Engineering(软件学院) Beijing Jiaotong University(北京交通大学) Department of Physiology and Pathophysiology, School of Basic Medical Sciences(基础医学学院生理与病理生理学系) Capital Medical University(首都医科大学) Center for Synthetic and Systems Biology, School of Life Sciences and School of Medicine(合成与系统生物学中心,生命科学学院,医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BAISBench通过评估AI科学家在单细胞转录组数据上的表现,推动生物发现的AI研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12262 2026-01-21 cs.SE cs.CL 70%

Environment-Aware Code Generation: How far are We?

环境感知代码生成:我们有多远?

Tongtong Wu, Rongyi Chen, Wenjie Du, Suyu Ma, Guilin Qi, Zhenchang Xing, Shahram Khadivi, Ramesh Periyathambi, Gholamreza Haffari

机构 * Monash University(墨尔本大学) Southeast University(东南大学) eBay Inc.(eBay公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出环境感知代码生成的研究,通过引入VersiBCB基准测试,探讨了数据、参数和缓存三个适应轴,揭示了LLMs在环境特定代码生成中的挑战与改进机会。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11531 2026-01-21 cs.HC cs.AI cs.SE 70%

NOVAID: Natural-language Observability Visualization Assistant for ITOps Dashboard Widget Generation

NOVAID:自然语言可观测性可视化助手用于IT运维仪表板小工具生成

Pratik Mishra, Caner Gözübüyük, Seema Nagar, Prateeti Mohapatra, Raya Wittich, Arthur de Magalhaes

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NOVAID利用大语言模型生成IT监控仪表板小工具,通过领域意识解析器和模糊匹配提高准确性,实现高效可视化辅助。

Comments 15 pages, 6 figures, accepted IAAI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-01-21 cs.CL 70%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Yingjie He, Zhaolu Kang, Kehan Jiang, Qianyuan Zhang, Jiachen Qian, Chunlei Meng, Yujie Feng, Yuan Wang, Jiabao Dou, Aming Wu, Leqi Zheng, Pengxiang Zhao, Jiaxin Liu, Zeyu Zhang, Lei Wang, Guansu Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI 70%

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13754 2026-01-21 cs.SE 67%

On Autopilot? An Empirical Study of Human-AI Teaming and Review Practices in Open Source

自动驾驶?开源软件中人类与AI协作及审查实践的实证研究

Haoyu Gao, Peerachai Banyongrakkul, Hao Guan, Mansooreh Zahedi, Christoph Treude

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究通过分析开源项目中AI辅助PR的互动模式,发现非所有权贡献者提交的AI共同撰写的PR被快速合并且反馈极少,揭示了AI在软件工程中的协作与审查实践问题。

Comments accepted as MSR short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13556 2026-01-21 cs.RO 67%

LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

LogicEnvGen: 基于任务逻辑的多样化模拟环境生成用于具身AI

Jianan Wang, Siyang Zhang, Bin Li, Juan Chen, Jingtao Qi, Zhuo Zhang, Chen Qian

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) School of Artifical Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LogicEnvGen通过任务逻辑驱动生成多样化模拟环境,提升智能体在不同环境中的适应性和鲁棒性评估性能。

Comments 19 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13437 2026-01-21 cs.CL cs.AI cs.LG 67%

MOSLD-Bench: Multilingual Open-Set Learning and Discovery Benchmark for Text Categorization

MOSLD-Bench: 多语言开放集学习与发现基准用于文本分类

Adriana-Valentina Costache, Daria-Nicoleta Dragomir, Silviu-Florin Gheorghe, Eduard Poesina, Paul Irofti, Radu Tudor Ionescu

机构 * Department of Computer Science, University of Bucharest(计算机科学系,布加勒斯特大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MOSLD-Bench是一个多语言开放集学习与发现基准,用于文本分类,包含960,000个数据样本,覆盖12种语言,提出新框架以连续发现和学习新类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 67%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18817 2026-01-21 cs.CV 67%

Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring

Disc3D:通过判别性对象指称自动校准高质量3D对话数据

Siyuan Wei, Chunjie Wang, Xiao Liu, Xiaosheng Yan, Zhishan Zhou, Rui Huang

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Disc3D通过自动化流程生成高质量3D对话数据,解决视角和对象指称模糊性问题,提升多模态大语言模型性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12491 2026-01-21 cs.HC 67%

VASTU: Value-Aligned Social Toolkit for Online Content Curation

VASTU:面向在线内容编纂的价值对齐社交工具包

Agam Goyal, Xianyang Zhan, Charlotte Lambert, Koustuv Saha, Eshwar Chandrasekharan

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 VASTU通过社区特定模型在内容编纂中实现价值对齐,微调的转换器表现最佳,揭示了学习社区规范的重要性。

Comments Preprint: 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏