Com relação a arquitetura e política de armazenamento de dados
e engenharia de dados — ingestão e armazenamento de grande
quantidade de dados Big Data, julgue o item subsequente.
A utilização da ingestão de dados para coletar dados de
várias fontes e enviá-los para um repositório Big Data pode
apresentar alguns desafios como usar os sistemas escaláveis,
para lidar com os grandes volumes de dados, garantir que os
dados sejam processados em tempo hábil, ter confiabilidade
e ser seguro.
Analise a afirmativa abaixo e assinale a alternativa que apresenta a qual conceito ela se refere.
É um repositório centralizado de dados que integra informações de várias fontes, transformando e armazenando esses dados de maneira otimizada para análise e geração de relatórios, possibilitando a tomada de decisões estratégicas fundamentadas dentro de uma organização.
À medida que as organizações começaram a utilizar
múltiplos repositórios ou bancos de dados para armazenar
diferentes tipos de informações de negócios, a
necessidade de integrar os dados cresceu rapidamente e
ETL tornou-se o método padrão utilizado na construção de
Data Warehouse (DW). As ferramentas ETL em um Data
Warehouse (DW) possuem a função de:
Ao construir um classificador usando aprendizado de
máquina, um analista deve verificar o quão efetivo ele é
para a predição, ou seja, estimar sua precisão preditiva,
uma vez que o erro é inerente ao processo – deseja-se
aprender sobre uma população, mas se tem acesso a uma
amostra dela. No caso da classificação, o conjunto de
treinamento é utilizado para aprender e um conjunto de
testes é utilizado para estimar o erro. Para estimar a
precisão preditiva de um classificador a partir de uma
amostra de dados não utilizada anteriormente ou não
conhecida, podem ser empregadas as seguintes
estratégias:
Máquinas de vetores de suporte (do inglês, Support Vector
Machine - SVM) são algoritmos de aprendizado de
máquina que possibilitam a implementação de
classificadores. Os modelos implementados a partir desses
algoritmos utilizam funções kernel, conferindo como
vantagem:
Uma Rede Neural Convolucional (do inglês, Convolutional
Neural Network - CNN) é um algoritmo de aprendizado de
máquina profundo que pode, a partir dos dados de entrada,
atribuir importância (pesos e vieses que podem ser
aprendidos) a vários aspectos dos dados e, portanto, obter
maior diferenciação. São características da arquitetura das
redes neurais convolucionais:
O LDA (do inglês, Latent Dirichlet Allocation) é um modelo
de aprendizado não supervisionado e estatístico utilizado
no Processamento de Linguagem Natural (PLN). No
processo de treinamento, o modelo LDA gera tópicos,
sendo que cada tópico incorpora uma quantidade de
palavras. Sob a mesma lógica, o resultado da aplicação do
LDA sobre um conjunto de documentos textuais pode ser
resumido como:
O Processamento de Linguagem Natural (PLN) é a área da
inteligência artificial que analisa, reconhece e/ou gera
textos em linguagens humanas (ou natural). Para
processar dados textuais, é necessário primeiramente
transformá-los em valores numéricos, sendo utilizados
algoritmos do tipo word embeddings, tais como glove, tf-idf,
word2vector e bag of words (BOW). São características do
algoritmo word2vector: