ChatPaper.aiChatPaper

OceanPile: Um Grande Corpus Oceânico Multimodal para Modelos de Base

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

April 25, 2026
Autores: Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen
cs.AI

Resumo

O vasto e subexplorado oceano desempenha um papel crítico na regulação do clima global e no suporte à biodiversidade marinha, no entanto, a inteligência artificial tem, até agora, tido um impacto limitado neste domínio devido a um estrangulamento fundamental de dados. Especificamente, os dados oceânicos são altamente fragmentados entre fontes díspares e apresentam inerentemente características multimodais, de alto ruído e com etiquetagem fraca, carecendo de esquemas unificados e de alinhamento semântico. Embora os Modelos de Linguagem de Grande Porte Multimodais (MLLMs) tenham alcançado sucesso notável em domínios gerais, a sua aplicação à ciência oceânica permanece severamente limitada pela ausência de conjuntos de dados multimodais de grande escala e bem alinhados, adaptados aos ambientes marinhos. Para colmatar esta lacuna, introduzimos o OceanPile, um *corpus* multimodal de grande escala concebido para modelos de base oceânicos. Este é composto por três componentes principais: o OceanCorpus, uma coleção unificada que integra dados de sonar, imagens subaquáticas, elementos visuais de ciências marinhas e texto científico de diversas fontes autorizadas; o OceanInstruction, um conjunto de dados de instrução de alta qualidade sintetizado através de um novo *pipeline* orientado por um Gráfico de Conhecimento de Conceitos Oceânicos hierárquico; e o OceanBenchmark, um ponto de referência de avaliação criteriosamente curado para uma avaliação rigorosa. Estabelecemos um processo de controlo de qualidade multiestágio para garantir a validade científica e o alinhamento entre modalidades. A validação experimental demonstra melhorias significativas de desempenho para modelos treinados com os nossos dados. Todos os conjuntos de dados são disponibilizados publicamente para fazer avançar o campo da inteligência artificial marinha e capacitar MLLMs específicos do domínio.
English
The vast and underexplored ocean plays a critical role in regulating global climate and supporting marine biodiversity, yet artificial intelligence has so far delivered limited impact in this domain due to a fundamental data bottleneck. Specifically, ocean data are highly fragmented across disparate sources and inherently exhibit multi-modal, high-noise, and weakly labeled characteristics, lacking unified schemas and semantic alignment. Although Multimodal Large Language Models (MLLMs) have achieved remarkable success in general domains, their application to ocean science remains severely constrained by the absence of large-scale, well-aligned multimodal datasets tailored to marine environments. To bridge this gap, we introduce OceanPile, a large-scale multimodal corpus designed for ocean foundation models. It comprises three key components: OceanCorpus, a unified collection integrating sonar data, underwater imagery, marine science visuals, and scientific text from diverse authoritative sources; OceanInstruction, a high-quality instruction dataset synthesized via a novel pipeline guided by a hierarchical Ocean Concept Knowledge Graph; and OceanBenchmark, a manually curated evaluation benchmark for rigorous assessment. We establish a multi-stage quality control process to ensure scientific validity and alignment across modalities. Experimental validation demonstrates significant performance improvements for models trained on our data. All datasets are publicly released to advance the field of marine artificial intelligence and empower domain-specific MLLMs.