{"id":476653,"date":"2023-08-09T07:31:20","date_gmt":"2023-08-09T07:31:20","guid":{"rendered":""},"modified":"2023-09-05T11:13:11","modified_gmt":"2023-09-05T11:13:11","slug":"data-lake","status":"publish","type":"wiki","link":"https:\/\/oneproxy.pro\/pt\/wiki\/data-lake\/","title":{"rendered":"Lago de dados"},"content":{"rendered":"<p>Os data lakes s\u00e3o paradigmas centralizados de armazenamento e gerenciamento de dados que permitem o armazenamento de grandes quantidades de dados brutos em seu formato nativo at\u00e9 que sejam necess\u00e1rios. Esses sistemas armazenam dados de diferentes fontes e suportam diferentes tipos de dados, incluindo dados estruturados, semiestruturados e n\u00e3o estruturados. Os usu\u00e1rios de uma organiza\u00e7\u00e3o podem acessar esses dados para diversas tarefas, como explora\u00e7\u00e3o de dados, ci\u00eancia de dados, armazenamento de dados e an\u00e1lises em tempo real.<\/p>\n<h2>A hist\u00f3ria e o surgimento dos data lakes<\/h2>\n<p>O termo \u201cData Lake\u201d foi introduzido pela primeira vez por James Dixon, CTO da Pentaho, uma empresa de integra\u00e7\u00e3o de dados, em 2010. Ele comparou um data mart (uma forma simples de data warehouse, focado em uma \u00fanica \u00e1rea funcional de um neg\u00f3cio) a uma garrafa de \u00e1gua, \u201climpa, embalada e estruturada para f\u00e1cil consumo\u201d, enquanto um data lake \u00e9 semelhante a um corpo de \u00e1gua em seu estado natural. Os dados fluem dos riachos (os sistemas de origem) para o lago, mantendo todas as suas caracter\u00edsticas originais.<\/p>\n<h2>Desvendando o conceito de data lakes<\/h2>\n<p>Um data lake mant\u00e9m dados em um formato n\u00e3o processado e inclui despejos de dados brutos. Este \u00e9 um afastamento significativo dos m\u00e9todos tradicionais de armazenamento de dados, que geralmente exigem que os dados sejam processados e estruturados antes de serem armazenados. Essa capacidade de armazenar dados n\u00e3o processados permite que as empresas aproveitem big data e permite an\u00e1lises complexas e aprendizado de m\u00e1quina, tornando-se uma ferramenta significativa no mundo atual, orientado por dados.<\/p>\n<p>Os data lakes armazenam dados de todos os tipos, incluindo dados estruturados de bancos de dados relacionais, dados semiestruturados como arquivos CSV ou JSON, dados n\u00e3o estruturados como e-mails ou documentos e at\u00e9 dados bin\u00e1rios como imagens, \u00e1udio e v\u00eddeo. Essa capacidade de lidar com diversos tipos de dados permite que as empresas obtenham insights de v\u00e1rias fontes de dados que talvez n\u00e3o conseguissem anteriormente.<\/p>\n<h2>Estrutura Interna e Funcionamento de Data Lakes<\/h2>\n<p>A estrutura interna de um data lake \u00e9 projetada para armazenar grandes quantidades de dados brutos. Os dados em um data lake normalmente s\u00e3o armazenados no mesmo formato em que chegam. Esses dados geralmente s\u00e3o armazenados em uma s\u00e9rie de blobs ou arquivos de objetos. Esses blobs de objetos podem ser armazenados de maneira altamente distribu\u00edda em uma infraestrutura de armazenamento escalon\u00e1vel, que geralmente abrange v\u00e1rios servidores ou at\u00e9 mesmo v\u00e1rios locais.<\/p>\n<p>A arquitetura do data lake \u00e9 uma forma altamente escalon\u00e1vel e flex\u00edvel de armazenar dados. Os dados podem ser adicionados ao lago \u00e0 medida que s\u00e3o gerados, sem a necessidade de qualquer processamento inicial ou design de esquema. Isso permite a ingest\u00e3o e an\u00e1lise de dados em tempo real. Os usu\u00e1rios podem ent\u00e3o acessar os dados brutos no lago, process\u00e1-los e estrutur\u00e1-los conforme necess\u00e1rio para suas necessidades espec\u00edficas. Isso normalmente \u00e9 feito por meio do uso de estruturas de processamento distribu\u00eddo, como Apache Hadoop ou Spark.<\/p>\n<h2>Principais recursos de data lakes<\/h2>\n<p>A seguir est\u00e3o alguns dos recursos essenciais dos data lakes:<\/p>\n<ul>\n<li>\n<p><strong>Escalabilidade<\/strong>: os data lakes podem lidar com uma enorme quantidade de dados, variando de terabytes a petabytes e al\u00e9m. Isso os torna ideais para armazenar big data.<\/p>\n<\/li>\n<li>\n<p><strong>Flexibilidade<\/strong>: Os data lakes podem armazenar todos os tipos de dados \u2013 estruturados, semiestruturados e n\u00e3o estruturados. Isso permite que as organiza\u00e7\u00f5es armazenem e analisem diversos tipos de dados em um s\u00f3 lugar.<\/p>\n<\/li>\n<li>\n<p><strong>Agilidade<\/strong>: os data lakes permitem a ingest\u00e3o r\u00e1pida de dados, pois os dados n\u00e3o precisam ser processados antes de serem armazenados. Eles tamb\u00e9m facilitam a explora\u00e7\u00e3o e descoberta de dados mais r\u00e1pida, pois os usu\u00e1rios podem interagir diretamente com os dados brutos.<\/p>\n<\/li>\n<li>\n<p><strong>Seguran\u00e7a e Governan\u00e7a<\/strong>: Os data lakes modernos incorporam medidas de seguran\u00e7a robustas e mecanismos de governan\u00e7a para controlar o acesso aos dados, garantir a qualidade dos dados e manter uma trilha de auditoria do uso dos dados.<\/p>\n<\/li>\n<\/ul>\n<h2>Tipos de lagos de dados<\/h2>\n<p>Os dois principais tipos de data lakes s\u00e3o:<\/p>\n<ol>\n<li>\n<p><strong>Lagos de dados locais<\/strong>: s\u00e3o implantados na infraestrutura de servidores locais de uma organiza\u00e7\u00e3o. Eles oferecem mais controle sobre os dados, mas exigem recursos significativos para configura\u00e7\u00e3o e manuten\u00e7\u00e3o.<\/p>\n<\/li>\n<li>\n<p><strong>Lagos de dados baseados em nuvem<\/strong>: s\u00e3o hospedados em plataformas de nuvem como Amazon S3, Azure Data Lake Storage ou Google Cloud Storage. Eles oferecem escalabilidade, flexibilidade e economia, mas dependem da seguran\u00e7a e da confiabilidade do provedor de servi\u00e7os em nuvem.<\/p>\n<\/li>\n<\/ol>\n<table>\n<thead>\n<tr>\n<th>Tipo<\/th>\n<th>Pr\u00f3s<\/th>\n<th>Contras<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Lagos de dados locais<\/td>\n<td>Controle completo sobre os dados, personaliz\u00e1vel para necessidades espec\u00edficas<\/td>\n<td>Alto custo de configura\u00e7\u00e3o e manuten\u00e7\u00e3o, uso intensivo de recursos<\/td>\n<\/tr>\n<tr>\n<td>Lagos de dados baseados em nuvem<\/td>\n<td>Altamente escal\u00e1vel e econ\u00f4mico<\/td>\n<td>Dependente da seguran\u00e7a e confiabilidade do provedor de servi\u00e7os em nuvem<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2>Utilizando Data Lakes: Desafios e Solu\u00e7\u00f5es<\/h2>\n<p>Os data lakes permitem que as organiza\u00e7\u00f5es obtenham insights valiosos de seus dados. No entanto, a sua implementa\u00e7\u00e3o e utiliza\u00e7\u00e3o n\u00e3o est\u00e3o isentas de desafios. Alguns desafios comuns incluem:<\/p>\n<ul>\n<li><strong>Qualidade de dados<\/strong>: os data lakes armazenam todos os dados, incluindo dados de baixa qualidade ou irrelevantes. Isso pode levar a resultados de an\u00e1lise ruins se n\u00e3o for resolvido.<\/li>\n<li><strong>Seguran\u00e7a e Governan\u00e7a<\/strong>: Gerenciar o acesso aos dados e manter uma trilha de auditoria pode ser complexo em um data lake devido \u00e0 sua natureza de armazenamento de dados brutos e n\u00e3o processados.<\/li>\n<li><strong>Complexidade<\/strong>: a grande quantidade de dados n\u00e3o processados em um data lake pode ser esmagadora e dif\u00edcil de navegar para os usu\u00e1rios.<\/li>\n<\/ul>\n<p>As solu\u00e7\u00f5es para estes desafios incluem a utiliza\u00e7\u00e3o de ferramentas de gest\u00e3o de metadados, ferramentas de cataloga\u00e7\u00e3o de dados, estruturas robustas de governa\u00e7\u00e3o de dados e forma\u00e7\u00e3o e educa\u00e7\u00e3o dos utilizadores.<\/p>\n<h2>Data Lakes versus conceitos semelhantes<\/h2>\n<p>Os data lakes costumam ser comparados com data warehouses e bancos de dados. Aqui est\u00e1 uma compara\u00e7\u00e3o:<\/p>\n<table>\n<thead>\n<tr>\n<th>Recurso<\/th>\n<th>Lago de dados<\/th>\n<th>Armaz\u00e9m de dados<\/th>\n<th>Base de dados<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Tipo de dados<\/td>\n<td>N\u00e3o estruturado, semiestruturado e estruturado<\/td>\n<td>Estruturada<\/td>\n<td>Estruturada<\/td>\n<\/tr>\n<tr>\n<td>Esquema<\/td>\n<td>Esquema na leitura<\/td>\n<td>Esquema na grava\u00e7\u00e3o<\/td>\n<td>Esquema na grava\u00e7\u00e3o<\/td>\n<\/tr>\n<tr>\n<td>Em processamento<\/td>\n<td>Lote e em tempo real<\/td>\n<td>Lote<\/td>\n<td>Tempo real<\/td>\n<\/tr>\n<tr>\n<td>Armazenar<\/td>\n<td>Alta capacidade, barato<\/td>\n<td>Limitado, caro<\/td>\n<td>Limitado, caro<\/td>\n<\/tr>\n<tr>\n<td>Usu\u00e1rios<\/td>\n<td>Cientistas de dados, Desenvolvedores de dados<\/td>\n<td>Analistas de neg\u00f3cios<\/td>\n<td>Usu\u00e1rios do aplicativo<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2>Perspectivas Futuras e Tecnologias Emergentes em Data Lakes<\/h2>\n<p>O futuro dos data lakes envolve maior automa\u00e7\u00e3o, integra\u00e7\u00e3o com an\u00e1lises avan\u00e7adas e ferramentas de aprendizado de m\u00e1quina e melhor governan\u00e7a de dados. Tecnologias como marca\u00e7\u00e3o automatizada de metadados, cataloga\u00e7\u00e3o de dados aumentada e gerenciamento de qualidade de dados baseado em IA est\u00e3o definidas para redefinir como os data lakes s\u00e3o gerenciados e usados.<\/p>\n<p>A integra\u00e7\u00e3o de data lakes com an\u00e1lises avan\u00e7adas e plataformas de aprendizado de m\u00e1quina est\u00e1 permitindo capacidades de an\u00e1lise de dados mais sofisticadas. Isto torna poss\u00edvel extrair insights acion\u00e1veis de vastos conjuntos de dados em tempo real, impulsionando o desenvolvimento de aplica\u00e7\u00f5es e servi\u00e7os mais inteligentes e baseados em dados.<\/p>\n<h2>Servidores proxy e data lakes<\/h2>\n<p>Os servidores proxy podem ser usados para aprimorar a implementa\u00e7\u00e3o do data lake, facilitando a transfer\u00eancia mais r\u00e1pida de dados e fornecendo uma camada adicional de seguran\u00e7a. Ao servirem como intermedi\u00e1rios para solicita\u00e7\u00f5es de clientes que buscam recursos de outros servidores, os servidores proxy podem ajudar a equilibrar cargas e melhorar as velocidades de transfer\u00eancia de dados, tornando a ingest\u00e3o e extra\u00e7\u00e3o de dados do data lake mais eficiente.<\/p>\n<p>Al\u00e9m disso, os servidores proxy podem fornecer anonimato \u00e0 fonte de dados, adicionando uma camada extra de seguran\u00e7a de dados, o que \u00e9 crucial no contexto do data lake, dadas as grandes quantidades de dados brutos, muitas vezes confidenciais, armazenados.<\/p>\n<h2>Links Relacionados<\/h2>\n<p>Para obter mais informa\u00e7\u00f5es sobre data lakes, consulte os seguintes recursos:<\/p>\n<ul>\n<li><a href=\"https:\/\/aws.amazon.com\/big-data\/datalakes-and-analytics\/what-is-a-data-lake\/\" target=\"_new\" rel=\"noopener nofollow\">O que \u00e9 um lago de dados?<\/a> \u2013Amazon AWS<\/li>\n<li><a href=\"https:\/\/towardsdatascience.com\/data-lake-a-brief-introduction-4fb1fad6d2df\" target=\"_new\" rel=\"noopener nofollow\">Data Lake \u2013 Uma Breve Introdu\u00e7\u00e3o<\/a> \u2013 Rumo \u00e0 ci\u00eancia de dados<\/li>\n<li><a href=\"https:\/\/docs.microsoft.com\/en-us\/azure\/architecture\/data-guide\/big-data\/\" target=\"_new\" rel=\"noopener nofollow\">Introdu\u00e7\u00e3o aos lagos de dados<\/a> \u2013 Documentos do Microsoft Azure<\/li>\n<li><a href=\"https:\/\/www.oreilly.com\/library\/view\/what-is-data\/9781491973890\/\" target=\"_new\" rel=\"noopener nofollow\">O que \u00e9 um Data Lake e por que isso \u00e9 importante?<\/a> \u2013 O\u2019Reilly Media<\/li>\n<li><a href=\"https:\/\/www.dataversity.net\/data-lakes-purposes-practices-patterns-platforms\/\" target=\"_new\" rel=\"noopener nofollow\">Data Lakes: finalidades, pr\u00e1ticas, padr\u00f5es e plataformas<\/a> \u2013 Dataversidade<\/li>\n<\/ul>","protected":false},"featured_media":468113,"menu_order":0,"template":"","meta":{"_acf_changed":false,"content-type":"","inline_featured_image":false,"footnotes":""},"class_list":["post-476653","wiki","type-wiki","status-publish","has-post-thumbnail","hentry"],"acf":{"faq_title":"Frequently Asked Questions about <mark>Data Lake: A Comprehensive Overview<\/mark>","faq_items":[{"question":"What is a Data Lake?","answer":"<p>A Data Lake is a centralized storage system that allows for the storage of large amounts of raw data in its native format until it is needed. These systems can store data from different sources and support different data types, including structured, semi-structured, and unstructured data.<\/p>"},{"question":"Who first introduced the term \"Data Lake\"?","answer":"<p>The term \"Data Lake\" was first introduced by James Dixon, the CTO of Pentaho, a data integration company, in 2010.<\/p>"},{"question":"How does a Data Lake work?","answer":"<p>Data lakes store data in an unprocessed format, often as a series of object blobs or files. Users can then access the raw data in the lake, process it, and structure it as required for their specific needs. This is typically done through the use of distributed processing frameworks such as Apache Hadoop or Spark.<\/p>"},{"question":"What are the key features of Data Lakes?","answer":"<p>Data Lakes are scalable, flexible, and agile. They can handle massive amounts of data, store all types of data - structured, semi-structured, and unstructured, and enable fast data ingestion. They also incorporate robust security measures and governance mechanisms.<\/p>"},{"question":"What are the two primary types of Data Lakes?","answer":"<p>The two primary types of Data Lakes are On-Premises Data Lakes and Cloud-Based Data Lakes.<\/p>"},{"question":"What are the challenges in implementing and using Data Lakes?","answer":"<p>Some common challenges include ensuring data quality, managing security and governance, and dealing with the complexity of navigating vast amounts of unprocessed data.<\/p>"},{"question":"How do Data Lakes compare with Data Warehouses and Databases?","answer":"<p>Data Lakes can store unstructured, semi-structured, and structured data, while Data Warehouses and Databases typically store only structured data. Data Lakes use a schema-on-read approach, while Data Warehouses and Databases use a schema-on-write approach.<\/p>"},{"question":"How can Proxy Servers be used with Data Lakes?","answer":"<p>Proxy Servers can enhance data lake implementation by facilitating faster data transfer and providing an additional layer of security. They can help balance loads and improve data transfer speeds, making data ingestion and extraction from the data lake more efficient.<\/p>"},{"question":"What are the future perspectives and emerging technologies in Data Lakes?","answer":"<p>The future of data lakes involves increased automation, integration with advanced analytics and machine learning tools, and improved data governance. Technologies such as automated metadata tagging, augmented data cataloging, and AI-powered data quality management are set to redefine how data lakes are managed and used.<\/p>"}]},"_links":{"self":[{"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/wiki\/476653","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/wiki"}],"about":[{"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/types\/wiki"}],"version-history":[{"count":0,"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/wiki\/476653\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/media\/468113"}],"wp:attachment":[{"href":"https:\/\/oneproxy.pro\/pt\/wp-json\/wp\/v2\/media?parent=476653"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}