arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-09 至 2026-03-09 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2603.05651 2026-03-09 cs.CL cs.AI cs.HC 91%

The Fragility Of Moral Judgment In Large Language Models

大语言模型中道德判断的脆弱性

Tom van Nuenen, Pratik S. Sachdeva

机构 * D-Lab, University of California, Berkeley(加州大学伯克利分校D实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究揭示大语言模型在道德判断中易受叙述形式和任务支架影响,其稳定性受协议和视角变化显著影响。

Comments 22 pages, 7 figures, 10 tables, plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 90%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06416 2026-03-09 cs.CL 89%

Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task

对大型语言模型中规范条件推理能力的评估:瓦森选择任务案例

Hirohiko Abe, Kentaro Ozeki, Risako Ando, Takanobu Morishita, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) University of Tokyo(东京大学) abelard.flet.keio.ac.jp(Keio大学abelard.flet实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究通过瓦森选择任务评估大型语言模型在规范规则下的条件推理能力,发现其表现与人类相似,存在匹配偏误等认知偏差。

Comments To appear in the Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06222 2026-03-09 cs.CL 89%

SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models

SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理

Yunlong Chu, Minglai Shao, Yuhang Liu, Bing Hao, Yumeng Lin, Jialu Wang, Ruijie Wang

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18077 2026-03-09 cs.CL 88%

Chain-of-Thought Reasoning Improves Context-Aware Translation with Large Language Models

基于链式推理的翻译改进:大型语言模型的上下文感知翻译

Shabnam Ataee, Hugo Huart, Andrei Popescu-Belis

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过链式推理提升大型语言模型在上下文感知翻译中的表现,发现推理能力显著提高翻译准确率。

Comments Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06428 2026-03-09 cs.CL cs.AI 87%

Abductive Reasoning with Syllogistic Forms in Large Language Models

基于三段论形式的大型语言模型演绎推理

Hirohiko Abe, Risako Ando, Takanobu Morishita Kentaro Ozeki, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在演绎推理中的准确性,通过转换三段论数据集探讨其偏见及改进方向,强调上下文推理的重要性。

Comments Published in Proceedings of the 3rd International Conference on Human and Artificial Rationalities (HAR 2024), LNCS 15504, pp. 3-17

Journal ref Lecture Notes in Computer Science, vol. 15504, pp. 3-17, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05900 2026-03-09 cs.LG cs.AI 86%

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

基于参考的策略优化用于分子优化 via LLM 推理

Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) CMIC, Shanghai Jiao Tong University(CMIC,上海交通大学) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Lab(虎盘实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 RePO通过结合强化学习和参考引导策略优化,在分子优化中提升探索与利用的平衡,优于SFT和RLVR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05696 2026-03-09 cs.CE cs.AI cs.CL cs.NA math.NA 86%

Autonomous Algorithm Discovery for Ptychography via Evolutionary LLM Reasoning

基于进化大语言模型推理的自主算法发现用于ptychography

Xiangyu Yin, Ming Du, Junjing Deng, Zhi Yang, Yimo Han, Yi Jiang

机构 * Advanced Photon Source, Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室先进光子源) Department of Materials Science and NanoEngineering, Rice University, Houston, TX, USA(材料科学与纳米工程系,德克萨斯大学里士满分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Ptychi-Evolve通过进化大语言模型推理,自主发现并优化正则化算法,提升ptychography图像重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00276 2026-03-09 cs.AI 85%

Localizing and Correcting Errors for LLM-based Planners

基于 LLM 的规划器的定位与错误修正

Aditya Kumar, William W. Cohen

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, US(语言技术研究所,卡内基梅隆大学,匹兹堡,美国) Machine Learning Department, Carnegie Mellon University, Pittsburgh, USA(机器学习系,卡内基梅隆大学,匹兹堡,美国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出 L-ICL 方法,通过局部上下文学习修正 LLM 规划器的错误,显著提升规划任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06064 2026-03-09 cs.AI 85%

Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation

通过分步PDDL模拟实现代理LLM规划:一项实证分析

Kai Göbel, Pierrick Lorang, Patrik Zips, Tobias Glück

机构 * AIT Austrian Institute of Technology GmbH(奥地利技术研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过PyPDDLEngine实验证明代理LLM在任务规划中相比传统方法具有小幅优势,但效果受环境反馈类型影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01288 2026-03-09 cs.LG 85%

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS: 通过熵动力学诊断LLM推理

Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EDIS通过分析LLM推理过程中的熵动态变化,识别错误推理的特征模式,提供有效的诊断信号以提升推理准确性。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06348 2026-03-09 cs.CL 84%

Transparent AI for Mathematics: Transformer-Based Large Language Models for Mathematical Entity Relationship Extraction with XAI

透明AI用于数学:基于Transformer的大语言模型用于数学实体关系提取与XAI

Tanjim Taharat Aurpa

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出基于Transformer的大语言模型,结合XAI方法,实现数学实体关系提取,达到高准确率并提升模型可解释性,为自动问题解决和知识图谱构建提供有效框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08105 2026-03-09 cs.CL 83%

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani

机构 * University of Toronto(多伦多大学) Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) OntarioTech University(安大略技术大学) Saarland University(萨尔兰州立大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。

Comments Accepted to EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06084 2026-03-09 cs.RO 82%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17598 2026-03-09 cs.CL cs.AI eess.AS 81%

The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?

级联等价假设:当语音大语言模型表现得像ASR→LLM流水线时

Jayadev Billa

机构 * San Jose CA, USA(加州圣何塞)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究语音大语言模型是否等价于ASR→LLM流水线,通过匹配骨干测试和机理分析,揭示其行为特性及在噪声下的性能差异。

Comments 10 pages, 6 figures, 7 tables. submitted for review Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05728 2026-03-09 cs.LO cs.AI cs.SE 79%

LTLGuard: Formalizing LTL Specifications with Compact Language Models and Lightweight Symbolic Reasoning

LTLGuard:利用紧凑语言模型和轻量符号推理形式化LTL规范

Medina Andresel, Cristinel Mateis, Dejan Nickovic, Spyridon Kounoupidis, Panagiotis Katsaros, Stavros Tripakis

机构 * AIT Austrian Institute of Technology(奥地利技术研究所) Aristotle University of Thessaloniki(希腊塞萨洛尼基亚里士多德大学) Northeatern University(东北大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 LTLGuard通过结合紧凑语言模型与轻量符号推理,有效生成无冲突的LTL规范,提升形式化验证的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02263 2026-03-09 q-bio.GN cs.AI 79%

LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization

LA-MARRVEL:一种基于知识、语言感知的LLM框架,用于临床稳健的罕见病基因优先级排序

Jaeyeon Lee, Lin Yao, Hyun-Hwan Jeong, Zhandong Liu

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(Jan和Dan Duncan神经研究 institutes) Texas Children’s Hospital(德克萨斯儿童医院) Quantitative and Computational Biosciences program(定量与计算生物科学项目)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 LA-MARRVEL通过基于知识和语言感知的LLM框架,提升罕见病基因优先级排序的准确性和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23405 2026-03-09 cs.LG 79%

Planner Aware Path Learning in Diffusion Language Models Training

扩散语言模型训练中的规划感知路径学习

Fred Zhangzhi Peng, Zachary Bezemek, Jarrid Rector-Brooks, Shuibai Zhang, Anru R. Zhang, Michael Bronstein, Alexander Tong, Avishek Joey Bose

机构 * Duke University(杜克大学) Mila Université de Montréal(蒙特利尔大学) California Institute of Technology(加州理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Oxford(牛津大学) AITHYRA Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出PAPL,一种通过规划感知路径学习提升扩散语言模型训练与推理一致性的方法,实现跨领域性能提升。

Comments Camera ready version for ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17938 2026-03-09 cs.CL cs.LG 79%

SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization

SPINE:基于熵带正则化的令牌选择性测试时间强化学习

Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

机构 * Monash University(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SPINE通过令牌选择性和熵带正则化提升测试时间推理稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02872 2026-03-09 cs.CV 78%

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

Think-as-You-See: 为大视觉-语言模型设计的流式推理链式思维

Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东技术学院) Ocean University of China(中国海洋大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 TaYS为大视觉-语言模型设计了流式推理链式思维框架,通过并行化生成、流约束训练和解耦的KV缓存,提升视频理解的效率和响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13238 2026-03-09 cs.CV 78%

DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model

DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力

Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06503 2026-03-09 cs.CL 77%

Beyond Rows to Reasoning: Agentic Retrieval for Multimodal Spreadsheet Understanding and Editing

超越行到推理:面向多模态电子表格理解与编辑的智能检索

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BRTR通过迭代工具调用框架实现多模态电子表格的端到端理解与编辑,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05911 2026-03-09 cs.CV cs.AI 77%

CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning

CORE-Seg: 通过强化学习实现复杂病灶的推理驱动分割

Yuxin Xie, Yuming Chen, Yishan Yang, Yi Zhou, Tao Zhou, Zhen Zhao, Jiacheng Liu, Huazhu Fu

机构 * Yuxin Xie 1 Yuming Chen 1 Yishan Yang 1 Yi Zhou 1 Tao Zhou 2 Zhen Zhao 3 Jiacheng Liu 3 Huazhu Fu 4

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 CORE-Seg通过强化学习实现复杂病灶分割,提出语义引导的提示适配器和渐进训练策略,取得更高Dice系数和更低失败率

Comments Under Review with Computational Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05818 2026-03-09 cs.CL 77%

RouteGoT: Node-Adaptive Routing for Cost-Efficient Graph of Thoughts Reasoning

RouteGoT: 用于图状思维推理的节点自适应路由

Yuhang Liu, Ruijie Wang, Yunlong Chu, Bing Hao, Yumeng Lin, Shengzhong Liu, Minglai Shao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 RouteGoT通过节点自适应路由框架提升图状思维推理的效率与准确性,实现性能与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03704 2026-03-09 cs.RO cs.AI 77%

Large-Language-Model-Guided State Estimation for Partially Observable Task and Motion Planning

基于大语言模型的态估计用于部分可观测任务和运动规划

Yoonwoo Kim, Raghav Arora, Roberto Martín-Martín, Peter Stone, Ben Abbatematteo, Yoonchang Sung

机构 * The University of Texas at Austin(德克萨斯大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CoCo-TAMP框架,利用大语言模型的常识推理能力,通过分层态估计提升部分可观测任务和运动规划的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02387 2026-03-09 cs.CL cs.AI cs.LG 75%

RM-R1: Reward Modeling as Reasoning

RM-R1: 作为推理的奖励建模

Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University(德克萨斯A&M大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RM-R1通过将奖励建模作为推理任务,提升模型的可解释性和性能,实验证明其在多个基准测试中表现优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06073 2026-03-09 cs.RO cs.AI 70%

Lifelong Embodied Navigation Learning

持续性具身导航学习

Xudong Wang, Jiahua Dong, Baichen Liu, Qi Lyu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) Shenyang Institute of Automation(沈阳自动化研究所) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05618 2026-03-09 cs.CL 70%

Safer Reasoning Traces: Measuring and Mitigating Chain-of-Thought Leakage in LLMs

更安全的推理轨迹:衡量和减轻大语言模型中的推理链泄露

Patrick Ahrend, Tobias Eder, Xiyang Yang, Zhiyi Pan, Georg Groh

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了大语言模型中推理链泄露问题,提出了一种模型无关的框架来衡量和减轻隐私风险,通过比较不同模型和预算下的泄露情况,提出了混合门卫策略以平衡效用与风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 67%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 67%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏