Saltar al contenido principal
Esta sección cubre todas las materializaciones disponibles en dbt-clickhouse, incluidas las características experimentales.

Configuraciones generales de materialización

La siguiente tabla muestra configuraciones compartidas por algunas de las materializaciones disponibles. Para obtener información más detallada sobre las configuraciones generales de los modelos de dbt, consulta la documentación de dbt:

Motores de tabla compatibles

Nota: para las vistas materializadas, se admiten todos los motores de la familia *MergeTree.

Motores de tabla compatibles experimentales

Si tienes problemas para conectarte a ClickHouse desde dbt con alguno de los motores anteriores, informa del problema aquí.

Una nota sobre la configuración del modelo

ClickHouse tiene varios tipos o niveles de “configuración”. En la configuración del modelo anterior, se pueden configurar dos de ellos. settings se refiere a la cláusula SETTINGS usada en sentencias DDL del tipo CREATE TABLE/VIEW, por lo que, en general, se trata de configuraciones específicas del motor de tabla concreto de ClickHouse. La nueva query_settings se usa para añadir una cláusula SETTINGS a las consultas INSERT y DELETE utilizadas para la materialización del modelo ( incluidas las materializaciones incrementales). Hay cientos de configuraciones en ClickHouse, y no siempre está claro cuál es una configuración de “tabla” y cuál es una configuración de “usuario” (aunque estas últimas suelen estar disponibles en la tabla system.settings). En general, se recomiendan los valores predeterminados, y cualquier uso de estas propiedades debe investigarse y probarse cuidadosamente.

Configuración de columna

NOTA: Las opciones de configuración de columna que se indican a continuación requieren que se apliquen los contratos de modelo.

Ejemplo de configuración de esquema

Añadir tipos complejos

dbt determina automáticamente el tipo de datos de cada columna analizando el SQL utilizado para crear el modelo. Sin embargo, en algunos casos, este proceso puede no determinar con precisión el tipo de datos, lo que genera conflictos con los tipos especificados en la propiedad data_type del contrato. Para solucionarlo, recomendamos usar la función CAST() en el SQL del modelo para definir explícitamente el tipo deseado. Por ejemplo:

Materialización: vista

Un modelo de dbt puede crearse como una vista de ClickHouse y configurarse con la siguiente sintaxis: Archivo del proyecto (dbt_project.yml):
O el bloque de configuración (models/<model_name>.sql):

Materialización: tabla

Un modelo de dbt puede crearse como una tabla de ClickHouse y configurarse con la siguiente sintaxis: Archivo del proyecto (dbt_project.yml):
O el bloque de configuración (models/<model_name>.sql):

Índices de omisión de datos

Puede añadir índices de omisión de datos a las materializaciones table mediante la configuración indexes:

Proyecciones

Puede añadir proyecciones a las materializaciones table y distributed_table mediante la configuración projections:
Nota: En las tablas distribuidas, la proyección se aplica a las tablas _local, no a la tabla proxy distribuida.

Materialización: incremental

El modelo de tabla se reconstruirá en cada ejecución de dbt. Esto puede ser inviable y extremadamente costoso para conjuntos de resultados de mayor tamaño o transformaciones complejas. Para resolver este problema y reducir el tiempo de compilación, un modelo de dbt puede crearse como una tabla incremental de ClickHouse y configurarse con la siguiente sintaxis: Definición del modelo en dbt_project.yml:
O bien en el bloque de configuración de models/<model_name>.sql:

Configuraciones

A continuación, se enumeran las configuraciones específicas de este tipo de materialización:

Estrategias para modelos incrementales

dbt-clickhouse admite tres estrategias para modelos incrementales.

La estrategia predeterminada (heredada)

Históricamente, ClickHouse solo ha ofrecido compatibilidad limitada con actualizaciones y eliminaciones, en forma de “mutaciones” asíncronas. Para emular el comportamiento esperado de dbt, dbt-clickhouse crea de forma predeterminada una nueva tabla temporal que contiene todos los registros “antiguos” no afectados (no eliminados, no modificados), además de cualquier registro nuevo o actualizado, y luego intercambia esta tabla temporal con la relación del modelo incremental existente. Esta es la única estrategia que conserva la relación original si algo sale mal antes de que se complete la operación; sin embargo, como implica una copia completa de la tabla original, su ejecución puede resultar bastante costosa y lenta.

La estrategia Delete+Insert

ClickHouse añadió las “eliminaciones ligeras” como una funcionalidad experimental en la versión 22.8. Las eliminaciones ligeras son significativamente más rápidas que las operaciones ALTER TABLE … DELETE porque no requieren reescribir las partes de datos de ClickHouse. La estrategia incremental delete+insert utiliza eliminaciones ligeras para implementar materializaciones incrementales con un rendimiento significativamente mejor que la estrategia “heredada”. Sin embargo, hay advertencias importantes al usar esta estrategia:
  • Las eliminaciones ligeras deben estar habilitadas en tu servidor de ClickHouse mediante la configuración allow_experimental_lightweight_delete=1, o debes establecer use_lw_deletes=true en tu perfil (lo que habilitará esa configuración para tus sesiones de dbt)
  • Las eliminaciones ligeras ya están listas para producción, pero puede haber problemas de rendimiento y de otro tipo en versiones de ClickHouse anteriores a la 23.3.
  • Esta estrategia opera directamente sobre la tabla/relación afectada (sin crear tablas intermedias ni temporales), por lo que, si surge algún problema durante la operación, es probable que los datos del modelo incremental queden en un estado no válido
  • Al usar eliminaciones ligeras, dbt-clickhouse habilita la configuración allow_nondeterministic_mutations. En algunos casos muy raros, al usar incremental_predicates no deterministas, esto podría dar lugar a una condición de carrera para los elementos actualizados/eliminados (y a los mensajes de log relacionados en los logs de ClickHouse). Para garantizar resultados coherentes, los predicados incrementales solo deben incluir subconsultas sobre datos que no se modificarán durante la materialización incremental.

La estrategia Microbatch (requiere dbt-core >= 1.9)

La estrategia incremental microbatch es una característica de dbt-core desde la versión 1.9, diseñada para gestionar de forma eficiente transformaciones de grandes volúmenes de datos de series temporales. En dbt-clickhouse, se basa en la estrategia incremental delete_insert existente y divide la carga incremental en lotes de series temporales predefinidos según las configuraciones del modelo event_time y batch_size. Además de gestionar transformaciones de gran tamaño, microbatch permite: Para obtener información detallada sobre el uso de microbatch, consulta la documentación oficial.
Configuraciones disponibles de Microbatch

La estrategia Append

Esta estrategia sustituye la configuración inserts_only en versiones anteriores de dbt-clickhouse. Este enfoque simplemente añade filas nuevas a la relación existente. Como resultado, las filas duplicadas no se eliminan y no hay ninguna tabla temporal ni intermedia. Es el enfoque más rápido si se permiten duplicados en los datos o si la consulta incremental los excluye mediante la cláusula/filtro WHERE.

La estrategia insert_overwrite (Experimental)

[IMPORTANT] Actualmente, la estrategia insert_overwrite no es totalmente funcional con materializaciones distribuidas.
Realiza los siguientes pasos:
  1. Crea una tabla temporal de preparación con la misma estructura que la relación del modelo incremental: CREATE TABLE <staging> AS <target>.
  2. Inserta únicamente los registros nuevos (generados por SELECT) en la tabla de preparación.
  3. Reemplaza únicamente las particiones nuevas (presentes en la tabla de preparación) en la tabla de destino.
Este enfoque tiene las siguientes ventajas:
  • Es más rápido que la estrategia predeterminada porque no copia la tabla completa.
  • Es más seguro que otras estrategias porque no modifica la tabla original hasta que la operación INSERT se completa correctamente: en caso de fallo intermedio, la tabla original no se modifica.
  • Aplica la buena práctica de ingeniería de datos de la “inmutabilidad de las particiones”, lo que simplifica el procesamiento incremental y paralelo de datos, las reversiones, etc.
La estrategia requiere que partition_by esté definido en la configuración del modelo. Ignora cualquier otro parámetro de la configuración del modelo específico de otras estrategias.

Materialización: materialized_view

La materialización materialized_view crea una vista materializada de ClickHouse que actúa como un disparador de inserción, transformando e insertando automáticamente nuevas filas de una tabla de origen en una tabla de destino. Esta es una de las materializaciones más potentes disponibles en dbt-clickhouse. Dado su alcance, esta materialización tiene su propia página dedicada. Ve a la guía de vistas materializadas para consultar la documentación completa

Materialización: diccionario (experimental)

Consulte las pruebas en https://github.com/ClickHouse/dbt-clickhouse/blob/main/tests/integration/adapter/dictionary/test&#95;dictionary.py para ver ejemplos de cómo implementar materializaciones para diccionarios de ClickHouse

Materialización: distributed_table (experimental)

La tabla distribuida se crea con los siguientes pasos:
  1. Crea una vista temporal con una consulta SQL para obtener la estructura correcta
  2. Crea tablas locales vacías a partir de la vista
  3. Crea una tabla distribuida a partir de las tablas locales.
  4. Los datos se insertan en la tabla distribuida, por lo que se distribuyen entre los segmentos sin duplicarse.
Notas:
  • Las consultas de dbt-clickhouse ahora incluyen automáticamente la configuración insert_distributed_sync = 1 para garantizar que las operaciones posteriores de materialización incremental se ejecuten correctamente. Esto podría hacer que algunas inserciones en tablas distribuidas se ejecuten más lentamente de lo esperado.

Ejemplo de modelo de tabla distribuida

Migraciones generadas

Configuraciones

A continuación se enumeran las configuraciones específicas de este tipo de materialización:

materialización: distributed_incremental (experimental)

Modelo incremental basado en la misma idea que una tabla distribuida; la principal dificultad es procesar correctamente todas las estrategias incrementales.
  1. La estrategia Append solo inserta datos en la tabla distribuida.
  2. La estrategia Delete+Insert crea una tabla temporal distribuida para trabajar con todos los datos en cada segmento.
  3. La estrategia predeterminada (heredada) crea tablas temporales e intermedias distribuidas por la misma razón.
Solo se reemplazan las tablas de segmento, porque la tabla distribuida no almacena datos. La tabla distribuida se vuelve a cargar solo cuando el modo full_refresh está habilitado o cuando la estructura de la tabla puede haber cambiado.

Ejemplo de modelo incremental Distributed

Migraciones generadas

Instantánea

Las instantáneas de dbt permiten registrar los cambios de un modelo mutable a lo largo del tiempo. Esto, a su vez, permite realizar consultas sobre modelos en un momento determinado, donde los analistas pueden “retroceder en el tiempo” para ver el estado anterior de un modelo. Esta funcionalidad es compatible con el conector de ClickHouse y se configura mediante la siguiente sintaxis: Bloque de configuración en snapshots/<model_name>.sql:
Para obtener más información sobre la configuración, consulta la página de referencia de configuración de snapshots.

Contratos y restricciones

Solo se admiten contratos de tipos de columna exactos. Por ejemplo, un contrato con una columna de tipo UInt32 fallará si el modelo devuelve un UInt64 u otro tipo entero. ClickHouse también admite solo restricciones CHECK sobre toda la tabla/modelo. No se admiten restricciones CHECK de clave primaria, clave foránea, únicas ni a nivel de columna. (Consulta la documentación de ClickHouse sobre las claves primarias/de ORDER BY.)
Última modificación el 25 de junio de 2026