Pular para o conteúdo principal
Apache Arrow é um formato de memória padronizado e orientado a colunas que ganhou popularidade na comunidade de dados. Neste guia, aprenderemos como consultar o Apache Arrow usando a função de tabela Python.

Configuração

Vamos criar primeiro um ambiente virtual:
E agora vamos instalar o chDB. Certifique-se de ter a versão 2.0.2 ou superior:
Agora, vamos instalar PyArrow, pandas e ipython:
Vamos usar o ipython para executar os comandos no restante do guia, que pode ser iniciado com:
Você também pode usar o código em um script Python ou no notebook de sua preferência.

Criando uma tabela Apache Arrow a partir de um arquivo

Primeiro, vamos baixar um dos arquivos Parquet do conjunto de dados Ookla usando a AWS CLI:
Se quiser baixar mais arquivos, use aws s3 ls para obter uma lista de todos eles e, em seguida, atualizar o comando acima.
Em seguida, vamos importar o módulo Parquet do pacote pyarrow:
E então podemos ler o arquivo Parquet em uma tabela do Apache Arrow:
O esquema é exibido abaixo:
E podemos obter o número de linhas e colunas chamando o atributo shape:

Consultando o Apache Arrow

Agora vamos consultar a tabela do Arrow no chDB. Primeiro, vamos importar o chDB:
Em seguida, podemos descrever a tabela:
Também podemos contar o número de linhas:
Agora, vamos fazer algo um pouco mais interessante. A consulta a seguir exclui as colunas quadkey e tile.* e, em seguida, calcula os valores médio e máximo de todas as colunas restantes:
Última modificação em 10 de junho de 2026