Magna Concursos

Foram encontradas 5.237 questões.

3737312 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FCC
Orgão: SEFAZ-PI
Um benefício específico da modelagem multidimensional para órgãos de controle governamental é a
 

Provas

Questão presente nas seguintes provas
3737307 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FCC
Orgão: SEFAZ-PI
Uma Analista de uma Secretaria da Fazenda está esclarecendo à sua equipe a respeito do framework Hadoop, explicando que o principal benefício da sua aplicação na análise de dados fiscais pela Secretaria é a
 

Provas

Questão presente nas seguintes provas
3737147 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FCC
Orgão: SEFAZ-PI
No contexto da modelagem dimensional, uma Secretaria da Fazenda deseja analisar os atendimentos realizados para otimizar seus serviços e melhorara satisfação dos cidadãos. Os dados disponíveis incluem informações sobre atendimentos, cidadãos, servidores e datas.
As tabelas relevantes são:
- Tabela de Fatos (Atendimentos): Contém informações sobre cada atendimento individual, como ID do atendimento, ID do cidadão, ID do servidor, ID da data, tipo de atendimento e tempo de atendimento.
-Tabela de Dimensão (Cidadãos): Contém informações sobre os cidadãos, como ID do cidadão, nome, idade, gênero e município.
- Tabela de Dimensão (Servidores): Contém informações sobre os servidores, como ID do servidor, nome, cargo e setor.
- Tabela de Dimensão (Datas): Contém informações sobre as datas, como ID da data, data completa, dia da semana, mês e ano.
Descreve corretamente a relação entre as tabelas de fato e as tabelas de dimensões nesse contexto:
 

Provas

Questão presente nas seguintes provas
3736456 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:

Uma plataforma de e-commerce deseja analisar automaticamente as avaliações deixadas pelos clientes nos produtos para determinar se são positivas ou negativas. Para isso, a equipe de ciência de dados está treinando um modelo de aprendizado de máquina para análise de sentimentos. Dado que as avaliações são textos não estruturados, a equipe experimentou diferentes métodos de representação vetorial para transformar os textos em formatos que o modelo pode processar. Após testar diferentes abordagens, eles obtiveram os seguintes resultados em um modelo de classificação de sentimentos:

Representação Vetorial Acurácia nos Dados de
Treinamento
Acurácia nos Dados de
Teste
Bag of Words (BoW) 95% 70%
TF-IDF 94% 73%
Word2Vec (CBOW) 90% 80%
BERT (Transformers) 89% 88%

Com base nos resultados apresentados, assinale a alternativa que descreve a melhor escolha de representação vetorial para este problema e sua justificativa.

 

Provas

Questão presente nas seguintes provas
3736454 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:
Em aprendizado de máquina, underfitting (subajuste) e overfitting (sobreajuste) são problemas que afetam o desempenho dos modelos. Considerando as definições apresentadas, assinale a alternativa que descreve a diferença entre esses dois problemas.
 

Provas

Questão presente nas seguintes provas
3736447 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:
Uma empresa multinacional lida com grandes volumes de dados provenientes de diversas fontes, incluindo bancos de dados transacionais, sensores IoT, logs de servidores e redes sociais, envolvendo dados estruturados e não estruturados. Durante o processo de armazenamento e recuperação de dados, a organização enfrenta desafios de desempenho e consistência.
Considerando o cenário descrito, assinale a alternativa que apresenta a abordagem mais adequada para otimizar a recuperação eficiente e garantir a integridade dos dados.
 

Provas

Questão presente nas seguintes provas
3736442 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:
O pré-processamento de textos é uma etapa importante¬¬no processo de análise e classificação de dados textuais. Ele visa transformar textos brutos em um formato adequado para ser utilizado em algoritmos de aprendizado de máquina. Entre as técnicas mais comuns no pré-processamento de textos, estão a remoção de stop words, a tokenização, a lematização e o estemização. Considere o texto original a seguir: "O carro estava muito sujo, então ele decidiu limpar o carro depois de um longo dia de trabalho. O carro ficou brilhante após a limpeza."
Com base nas técnicas de pré-processamento citadas, como ficará o texto original após a aplicação de tokenização e remoção de stop words?
 

Provas

Questão presente nas seguintes provas
3736441 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:
Um modelo de linguagem baseado em unigramas foi treinado em um grande volume de textos em português. Esse modelo atribui probabilidades a palavras individuais, sem levar em consideração a ordem em que aparecem na sentença. Sabendo-se que a perplexidade é uma métrica que mede quão bem um modelo de linguagem prediz um texto, assinale a alternativa que melhor representa a perplexidade do modelo nas frases "qual sanduíche Maria comeu" e "Maria comeu o sanduíche". 
 

Provas

Questão presente nas seguintes provas
3736440 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:
Em aprendizado de máquina, a calibração de hiperparâmetros é um processo importante para otimizar o desempenho de um modelo. Considere o seguinte cenário: Você está treinando um modelo de Random Forest para prever o preço de imóveis e percebe que o desempenho do modelo não está satisfatório. Após uma análise, você decide calibrar os hiperparâmetros para tentar melhorar o modelo. Para isso, você seleciona os seguintes hiperparâmetros para calibração: 

n_estimators (número de árvores na floresta); • max_depth (profundidade máxima de cada árvore); • min_samples_split (número mínimo de amostras necessárias para dividir um nó). 

Assinale a alternativa que apresenta a melhor abordagem para encontrar a combinação ideal desses hiperparâmetros.
 

Provas

Questão presente nas seguintes provas
3736439 Ano: 2025
Disciplina: TI - Ciência de Dados e BI
Banca: FUVEST
Orgão: USP
Provas:

Os algoritmos de clusterização são utilizados na ciência de dados para agrupar elementos semelhantes com base em suas características. Um dos métodos mais comuns para medir a similaridade entre pontos é a distância Euclidiana, que calcula o quão próximos ou distantes os elementos estão em um espaço multidimensional. Essa métrica é a base para a determinação da formação dos clusters em algoritmos como K-Means e DBSCAN. Uma empresa deseja agrupar clientes com base em seu comportamento de compra. Para isso, foram coletados dois atributos: a quantidade de produtos diferentes comprados no último mês (X) e o valor total gasto (em centenas de reais) (Y). A tabela, a seguir, apresenta os dados coletados de quatro clientes, que serão usados para gerar a matriz de distâncias com base na distância Euclidiana:

Cliente Qtde de produtos (X) Valor Gasto (Y)
A 2 3
B 5 7
C 1 4
D 6 2

Em relação à matriz de distância gerada, assinale a alternativa correta.

 

Provas

Questão presente nas seguintes provas