Foram encontradas 5.237 questões.
Ana está desenvolvendo um banco de dados analítico a partir da integração de dados do sistema de pagamento com o sistema de gestão de pessoal. No sistema de pagamento, os colaboradores são identificados pelo CPF. No sistema de gestão de pessoal, os colaboradores são identificados pelas iniciais do seu nome concatenadas com sua data de nascimento. Ana sabe que essas chaves primárias naturais apresentam diversas desvantagens e riscos para um ambiente de análise de dados integrados, como seu reuso e alteração de regras de composição, além de questões de desempenho.
Com isso, para carregar os dados no banco de dados analítico, Ana desenvolveu um ETL que substituiu as chaves naturais dos sistemas por uma chave artificial contendo inteiros simples sequenciais, utilizando uma:
Provas
Como analista de dados, Joaquim quer comparar os dados de vendas dos produtos de bandeiras e torcidas da sua empresa com os resultados da Copa do Mundo ao longo dos anos. Para isso, Joaquim precisa dos dados dos vencedores das Copas que estão disponíveis em https://pt.wikipedia.org/wiki/Lista_de_finais_da_Copa_do_Mundo_FIFA.
No Power BI, para obter os dados disponíveis na URL https://pt.wikipedia.org/wiki/Lista_de_finais_da_Copa_do_Mundo_FIFA, Joaquim deve selecionar a fonte de dados do tipo:
Provas
A recente explosão de machine learning e deep learning tornou os tensores populares. TensorFlow e PyTorch são dois frameworks com suporte a API de tensor.
Em relação aos tensores, assinale a opção incorreta.
Provas
1. linhas = sc.textFile("dados.txt")
2. linhasComprimento = linhas.map(lambda s: len(s))
3. totalComprimento = linhasComprimento.reduce(lambda a, b: a + b)
Em relação ao código pyspark acima, assinale a afirmativa incorreta.
Provas
O principal objetivo do Hadoop YARN foi dividir as funcionalidades de gerenciamento de recursos e agendamento/monitoramento de tarefas em daemons separados.
Assinale a opção que não figura como uma característica da arquitetura de Hadoop YARN.
Provas
Considere a consulta de streaming que conta os cliques dos usuários por país para uma campanha publicitária na web a cada 30 minutos. Ao aplicar o modelo de processamento de micro batch a esta consulta, o fluxo de dados é dividido em duas fases: batching e processing, como mostra a figura a seguir.

O processamento stream é obtido repetindo as fases de batching e processing para as novas tuplas de dados.
Em relação ao processamento stream em micro-batches, assinale a opção incorreta.
Provas
O Apache Spark é um framework para processamento paralelo e oferece suporte ao processamento na memória para aumentar o desempenho de aplicações de big data.
Em relação aos RDDs e a suas operações, assinale a afirmativa incorreta.
Provas
Matei Zaharia et al. propuseram o framework Spark como alternativa para processar workloads que reutilizam dados através de múltiplas operações paralelas.
As opções a seguir apresentam características do framework Spark, à exceção de uma. Assinale-a.
Provas
Sobre o conceito de Governança de Dados (DAMA), assinale a afirmativa correta.
Provas
Kimball elenca uma série de conceitos fundamentais para a elaboração de um modelo dimensional.
Em relação a esses conceitos, assinale a afirmativa incorreta.
Provas
Caderno Container