Propósito

✔ Programação GLOBAL® - Quaisquer soluções e/ou desenvolvimento de aplicações pessoais, ou da empresa, que não constem neste Blog devem ser tratados como consultoria freelance. Queiram contatar-nos: brazilsalesforceeffectiveness@gmail.com | ESTE BLOG NÃO SE RESPONSABILIZA POR QUAISQUER DANOS PROVENIENTES DO USO DOS CÓDIGOS AQUI POSTADOS EM APLICAÇÕES PESSOAIS OU DE TERCEIROS.

.: Vitrine

Carregando artigos...

Views

Mostrando postagens com marcador Data Mining. Mostrar todas as postagens
Mostrando postagens com marcador Data Mining. Mostrar todas as postagens

DATA MINING - Está Morto?

Inline image 6
Não acho que o DATA MINING esteja morto. Antes foi renomeado como BIG DATA ou DATA SCIENCE, embora a ciência de dados vá além da mineração de dados. Talvez pouco mais de 20% do DATA SCIENCE sejam mineração de dados puro, que é a análise exploratória para detectar padrões, grupos, etc, e desenvolver soluções preditivas ou automações visuais ou sistemas automatizados, tais como detecção de fraudes, licitações automatizadas ou recomendações customizadas (músicas, livros, restaurantes, Facebook, etc...) para indivíduos visados​​.

Certamente a mineração de dados é a própria essência da DATA SCIENCE  juntamente com ARCHITECTURE / DATA WAREHOUSING / DATABASE MODELING.

SCIENCE / MINING / DATA QUALQUER-QUE-SEJA-O-NOME-PELO-QUAL-DESEJE-CHAMAR não está nem perto de morto. Na verdade, acho que está é apenas começando. 

Se não usarmos dados históricos, como poderemos prever? 

Basta usarmos os dados para tomarmos uma decisão e isso pode ser chamado de análise de dados ou de SCIENCE

Criamos dados num ritmo sem precedentes, o que irá permitir o uso mais amplo de criação e aperfeiçoamento dos modelos de dados. Estamos criando dados que nunca existiram antes, dando uma nova vida e propósito para eles.


A opinião mais popular sobre mineração de dados - construção de modelos automatizados que geram uma visão prospectiva - não está apenas longe de estar morta, mas precisa de expectativas substanciais de nivelamento dentro do contexto de grandes volumes de dados.


Quanto aos sistemas ineficientes que observamos em muitas empresas, isso deve-se ao fato destas se esforçarem na busca de respostas a partir de uma postura proativa.

Talvez a sensação de estarem sobrecarregadas com muitos dados venha do fato de que estejam fazendo as perguntas erradas. Mas se as pessoas fazendo as perguntas forem as pessoas mais experientes na organização, então estas serão mais precisas. 

Deixando de lado o significado dos termos da moda, geralmente os membros das organizações aprenderão com os seus próprios comportamentos, olhando para o passado. Uma vez que saibam o que estão fazendo, em seguida, as suas medidas podem ser criadas para monitorar as próprias práticas.

Enquanto alguém quiser encontrar uma ideia, um conceito ou uma suposição, então é lógico que a mineração de dados estará viva.


Deixe os seus comentários! Envie este artigo, divulgue este link na sua rede social...


Tags: data mining, big data, data science, architecture, data warehousing, database, modeling 


Excel Data Mining - Processando Bilhões de Linhas via Clound - New, fast Excel to process billions of rows via the cloud



Essa ideia não é nova - Uma aplicação desenvolvida no MS Excel capaz de lidar com grandes conjuntos de dados, de forma muito rápida.

Estive usando o MS Excel em 89% do tempo da minha carreira, e ele definitivamente tem algumas características muito poderosas. Provavelmente, a maior delas é a sua capacidade de prover modelos de design, propiciar testes e atualização em tempo real. Sim, basta alterarmos alguns poucos valores, configurados como parâmetros qual kernel do nosso modelo de análise, e todas as nossas células, em alguns casos milhares delas, e tudo o que estiver ligado a este núcleo, inclusive gráficos, serão atualizados ao mesmo tempo.


Outro recurso interessante inclue a capacidade do MS Excel de conectar-se a bancos de dados ou pela Internet (por exemplo, no Bing API) extraindo informações úteis, resumindo-as em cubos e tabelas dinâmicas. 

Embora os cubos e as tabelas dinâmicas dêem uma forte sensação de um ambiente old-fashioned de banco de dados relacional SQL, estes, em muitos contextos, continuam sendo úteis. 

Não estou muito certo no momento, de que o MS Excel possa facilmente recuperar dados através da Internet, a partir de API que não sejam da Microsoft, como por exemplo a API do Google. Deveria, mas alguns testes mostram que as próprias APIs têm limitações quanto a recuperação de dados, limitando os usuários finais, mas isso também mudará.

Hoje, a principal desvantagem é a lentidão do MS Excel.

Se classificarmos 400.000 observações (numa coluna), isso será muito rápido. Mas digamos que precisemos classificar simultaneamente duas colunas: A e B, onde B é o registro de um valor. Assim, B contém uma fórmula em cada linha. Se você for heavy user, sabe do que estou falando. Isso diminui drasticamente o tempo. O Excel é muito mais rápido para classificar uma só coluna. As fórmulas em B atualizarão corretamente todos os valores, muito rápido, e automaticamente.

Como regra geral, qualquer operação que envolva recálculo (digamos) 200.000 linhas em várias células ligadas por relações de dependência serão muito lentas se:


Uma das colunas incluir funções como VLOOKUP em cada célula.


Ordenar (SORT) ou outro processo sub-linear sendo processado.


Há uma maneira muito fácil e eficiente (mas feia) em torno disso, e estou querendo saber por que ela não está embutido de forma transparente para o usuário no MS Excel.


Por exemplo:



Substitua as fórmulas PROCV por valores hard-coded, realizando as atualizações dos valores hard-coded, e depois colocando-as de volta nas fórmulas.



Realize o SORT apenas no número mínimo de colunas, onde necessário, e atualize as células nas colunas que envolverem as fórmulas.

Pense: Por que o PROCV é tão lento?

Uso um dataset de 3.000.000 de linhas com um join em uma tabela de 200.000 linhas em Perl, e é muito rápido. No Excel, o dataset da tabela de pesquisa seria armazenado em duas pastas diferentes dentro da mesma planilha, e levaria dias se é que for possível realizar esse " join ". Talvez o Excel execute indiretamente uma junção completa exponencialmente para abrandar a operação? Eu quase nunca faço, e as pessoas quase nunca fazem uma junção completa em grandes conjuntos de dados. Certamente esta é uma área onde melhorias significativas são esperadas.

Ainda não tive chance de usar o MS Excel na nuvem, se é que isso é possível, mas isso seria uma ótima maneira de novos cálculos com velocidade em dados de processo muito maior do que 1 milhão de linhas.

A Microsoft deveria permitir que o usuário exportasse os dados em uma nuvem (Microsoft ? ) De uma forma transparente, com apenas um clique (por exemplo, basta clicar em " Export to cloud " ), e em seguida, permitir que o usuário simulasse as operações demoradas na versão local do Excel em sua área de trabalho (equivaleria a usar a planilha Excel local, como uma planilha virtual) e quando terminasse, clicaríamos em "recuperar da nuvem " e obtermos a nossa planilha atualizada.

O "recuperar da nuvem " seria:

Enviar as suas fórmulas do Excel para a nuvem,

Aplicar a fórmula para a sua versão cloud dos dados, 

E então obtemos os dados processados ​​de volta na sua planilha local.

Outro processo lento e doloroso é quando precisamos aplicar uma fórmula para uma coluna inteira com 500.000 células. Felizmente, existe um truque. Digamos que você deseje armazenar o produto de A e B na coluna C.

Em primeiro lugar, selecione toda a coluna C.

Insira a fórmula de = A1 * B1

Pressione a tecla Ctrl e a tecla Enter juntos.

Mas você pode fazer isso de modo ainda mais fácil do que isso, use algo como: 

== A1 * A1 ( fórmula com duplo igual indica que a fórmula se aplica a toda a coluna, e não apenas uma célula). 

Este é outro exemplo de como o Excel não é user-friendly. Muitas vezes, alguns caminhos tornam-se obscuros para resolvermos algo de forma eficiente.

TagsVBA, excel, data, mining, row, API, data mining, Clound, New, fast Excel, rows, cloud


Pharma Brazil: FRANÇA - Mais velha, mais esperta, mais valor consciente: A transformação do consumidor




As tendências de longo prazo remodelam a paisagem do consumidor na França e têm implicações em outros países desenvolvidos também.

Ao longo dos próximos 20 anos tendências demográficas, sociais e econômicas poderosas prometem reformular substancialmente o comportamento do consumidor em muitas das nações mais ricas do mundo. As implicações para os negócios será significativas. Para entender melhor essas tendências, analisou-se algumas perspectivas na França e descobriu-se que lá, como em muitos dos seus vizinhos europeus, a família média em 2030 será mais velha, mais instruída e menos rica do que a média das famílias de 2010.

Encontramos três tendências de longo prazo, atingindo um ponto de inflexão que transformará radicalmente os países:

- O envelhecimento da população, 

- Mudanças sociais que alteram como as famílias se parecem, e

- Fatores econômicos retardando a expansão da riqueza. 

Como essas tendências varrerão a França e, em graus variados, o resto da Europa, imporão pressão sobre o crescimento do consumo, mudando radicalmente a paisagem do consumidor.

Uma nação em transformação
A população da França está envelhecendo com o aumento da longevidade, as taxas de queda da fertilidade, e os mais velhos da geração baby boom. Estas tendências têm implicações econômicas profundas, pressionando o crescimento do PIB per capita, e o poder de compra e consumo. Talvez em 2030, por exemplo, mais de metade de todas as famílias francesas sejam dirigidas por alguém com 55 anos ou mais. Em toda a Europa, apenas dois trabalhadores apoiarão cada aposentado em 2050, em comparação com quatro de hoje, a menos que haja mudanças da idade de aposentadoria.

Uma série de mudanças sociais estão reformulando a família francesa média. Estes incluem aumento da escolaridade, mais mulheres participando do mercado de trabalho e famílias menores, menos casais formais e a queda da taxa de natalidade. Prevemos que o número de famílias francesas com casais que vivem juntos caia para 58 por cento em 2030, dos 75 por cento em 1980, enquanto as famílias terão uma média de 2,5 membros, contra 3,3 em 1980.



Tags: chart, Pharma, farmacêutica, análise, Data Mining, algoritmo, Mineração de Dados, keyword,  global, pharmaceutical, Sales, products, Georges Desvaux, Baudouin Regout, McKinsey Quarterly, McKinsey Global Institute, 


diHITT - Notícias