Mostrar mensagens com a etiqueta dados. Mostrar todas as mensagens
Mostrar mensagens com a etiqueta dados. Mostrar todas as mensagens

sexta-feira, 1 de setembro de 2023

Genealogia

Descobrir as raízes, organizar a informação relativa aos nossos antepassados, tem fortes relações com a Informática.
Cada um organiza a sua pesquisa genealógica como entende, e há muitas alternativas hoje, cada uma com as suas vantagens e inconvenientes.
Eu sempre usei uma plataforma online gratuita para guardar a minha árvore, comecei pelo MyHeritage, e, quando atingi os primeiros 500 membros, porque na altura deixava de ser gratuita, passei para o Ancestry.
Apesar dessa limitação ter desaparecido, hoje continuo a usar o Ancestry, e anexo a cada pessoa da árvore os registos paroquiais respectivos, outros documentos, e mesmo fotos.
Raiz da minha árvore genealógica no Ancestry
Realmente, mantenho cópias da minha árvore noutras plataformas, desde logo no MyHeritage e no Geneanet, tirando partido do facto de haver um formato de ficheiro genealógico GEDCOM compatível com estas plataformas, e não só.
Como estas plataformas enviam aos utilizadores muitas sugestões de familiares, algumas certas, outras erradas, embora quase todas acessíveis através de um registo pago, que eu nunca fiz, há sempre uma pista ou outra que se pode aproveitar.
E também todas permitem imprimir a nossa árvore em diversos formatos, como esta, retirada do Geneanet
Árvore importada do Geneanet.org (5 gerações)
Comecei por pesquisar directamente nos registos paroquiais online.
Os registos paroquiais até 1910, ou um pouco mais, excepto os que se extraviaram, estão guardados nos Arquivos Distritais e acessiveis através das suas plataformas, ou então usando o indispensável Tombo.pt, que disponibiliza links para todos os livros, e muitos mais documentos, e mesmo uma extensão para o Chrome, uma ferramenta de leitura dos livros paroquiais com muita utilidade.
Outra plataforma indispensável é o blogue GenealogiaFB.
Sendo a genealogia uma actividade colaborativa, pela simples razão de o mesmo antepassado poder pertencer a múltiplas árvores, e ser desafiante saber o que outros descobriram sobre esse antepassado nosso, neste momento rendi-me ao FamilySearch como instrumento de pesquisa.
O FamilySearch basicamente digitalizou a maior parte dos registos disponíveis em todo o mundo, indexou-os automaticamente, com os erros inerentes à leitura automática de manuscritos muitas vezes quase indecifráveis, e permite associá-los a pessoas.
Tem o conceito de árvore genealógica única, construída através da junção das contribuições de todos, e sempre que acrescentamos uma pessoa à nossa árvore ele tenta saber se essa pessoa por acaso já estará nessa árvore gigante ou não, procurando evitar duplicações.
Todas as acções ou correcções ficam registadas.
É uma ferramenta bastante mais complexa que as anteriores, mas em que, na minha opinião, vale a pena investir tempo.
Finalmente, visito muitas vezes o forum de genealogia Geneall, para procurar interessados nas minhas investigações.
[uma continuação aqui]

terça-feira, 14 de julho de 2020

Ciência de Dados

Os computadores, como todas as máquinas, são produtos da mente humana, e terão como última utilidade aliviar os humanos de tarefas em que os podem substituir com vantagem, esperando-se que daí resulte uma vida mais feliz, mais tempo livre, e uma sociedade mais inteligente.
Talvez por isso, saber como funciona um computador, saber configurar ou manter em funcionamento um parque de máquinas, mesmo saber programá-las, é útil, mas fica muito longe de contribuir para responder aos desafios que nos são colocados.
No mundo de hoje, as competências digitais não são simples competências para programar, ou para lidar com as tecnologias. São competências para pensar e planear para um mundo digital, para analisar problemas e formular soluções que possam ser executadas automaticamente por uma máquina de processamento de informação.
Ao desafios de lidar com as tecnologias, soma-se agora a necessidade de compreender como funciona o mundo global, a economia do conhecimento, as redes, a propagação de ideias, o contágio, a influência, e as decisões que afectam as nossas vidas.
Neste mundo de dados, saber onde os encontrar, saber extrair informação, saber formular questões baseadas em dados, saber obter as respostas, são competências essenciais em todas as áreas científicas, e nomeadamente nas ciências sociais e humanas, aquelas que estudam os nossos comportamentos individuais e colectivos.
Estamos a falar de Ciência de Dados, uma área que está a crescer em todo o mundo e também em Portugal, onde já são várias as Universidades que oferecem Licenciaturas e Mestrados, e uma área apetecível, para o bem e para o mal... todos nos lembramos da utilização de dados das redes sociais para interferir em eleições, do crédito social dos chineses, ou da ameaça de monitorização do pensamento de cada um...
De qualquer modo, como sempre na vida, a ignorância é o maior perigo...

terça-feira, 24 de março de 2020

Modelos matemáticos e contágios

Numa população, um elemento infectado pode provocar uma epidemia, ou não.
Se o contágio se fizer por contacto físico (social), os principais parâmetros a considerar serão o número de contactos (por dia) e a probabilidade de um contacto provocar um contágio.
Outros parâmetros importantes, serão o tempo da infecção, percentagem de casos letais, e se os sobreviventes ficam vacinados, ou não.
Numa população que se distribui de uma forma não uniforme, em comunidades com hábitos sociais variados, com distribuição geográfica variada, com dados de fiabilidade não comprovada, sugere um grande desafio de modelação e de previsão.
Num grupo uniforme, se, por exemplo, um infectado provocar 2 contágios por dia, aparentemente teremos um crescimento exponencial 1-2-4-8-16-32-64-128-... Será assim? Não parece.
O modelo exponencial só é válido numa população infinita, ou então, em grupos uniformes e enquanto o contágio não atinja valores significativos.
Nesta figura, o ajuste de uma curva exponencial a um caso real, a pandemia Coronavírus em Portugal na data de hoje: (ver código aqui)


Para estes números, parece aceitável a aproximação, que, basicamente, é um modelo recursivo, em que a população infectada no momento n depende apenas da população infectada momento n-1, ou seja, x(n)=Rx(n-1). No exemplo da figura, R=1.28.
Numa população finita, nomeadamente num grupo pequeno, o modelo exponencial tem limites, os valores atingidos não podem aproximar-se do total da população.
É aqui que surge o mapa logístico, mencionado noutro local deste blogue, também um modelo recursivo, mas que tenta reflectir a ideia de que a população infectada no momento n é proporcional à população infectada e à população não infectada no momento n-1, ou seja, x(n)=Rx(n-1)[N-x(n-1)].
Sem perda de generalidade, costuma considerar-se a população total ser 1 e x ser a fracção da população, e não o seu valor absoluto. Nesta figura, uma simulação com x(0)=0.0002 e R=1.28:


A população infectada cresceria muito rapidamente, abrandando para atingir o seu máximo em menos de 40 dias. Mas seriam catastróficos os valores atingidos.
Um modelo tem de ser mais elaborado, não se pode ficar pelo ponto de equilíbrio correspondente à exaustão da população. É necessário entrar em linha de conta com a percentagem de infectados que se tornam imunes, com o tempo de incubação, com a distribuição não uniforme da população, etc.
Curiosamente, estes modelos não andam muito longe dos modelos de influência, de contágio, de propagação de ideias nas redes sociais, desde a política à moda.
A revisitar noutro momento.

segunda-feira, 2 de abril de 2018

O problema do coleccionador de cartas

Os supermercados têm o hábito de, em certas alturas, oferecer aos (filhos dos) seus clientes umas cartas para coleccionar. As cartas são oferecidas aleatóriamente, não podendo os clientes escolhê-las.
A questão consiste em saber quantas cartas terá um coleccionador de acumular, em média, para completar a sua colecção.
É um problema semelhante àquele de saber quantos lançamentos de um dado deve uma pessoa fazer, em média, para obter as seis faces. A resposta a esta questão é
que é a soma dos inversos das probabilidades de sair a primeira, a segunda, a terceira, a quarte, a quinta e a sexta faces, respectivamente.
No caso geral de N cartas,
que pode ser um número "assustadoramente" grande. Por exemplo, para 100 cartas, o número é 518.7, ou seja, em média, seria necessário recolher mais de 518 cartas para completar a colecção.
Este processo aleatório caracteriza-se por ter uma cauda longa, isto é, pode acontecer ser necessário esperar um tempo estranhamente longo para obter todos os resultados...
O gráfico seguinte corresponde a 1100 milhões de simulações do jogo dos dados, e houve uma vez em que foram necessários 127 lançamentos para saírem as seis faces!
Entretanto, a moda, o valor mais frequente, foi 11, bem inferior à média de 14.7!
(recordo aqui uma simulação em NetLogo que há uns tempos propus)

sábado, 28 de outubro de 2017

HEART ou EARTH

Este problema apareceu no site brilliant.org.
Uma máquina de escrever está a gerar aleatoriamente uma sequência de caracteres de A a Z, todos com igual probabilidade de ocorrência. Dada uma palavra qualquer, essa palavra deverá eventualmente surgir escrita pela máquina, ao fim da geração de um número suficiente de caracteres.
Uma palavra de 5 letras, requererá em média a geração de 26^5 = 11881376 caracteres.
A questão é a seguinte: das duas palavras HEART e EARTH, haverá uma com maior probabilidade de ser escrita em primeiro lugar, ou as probabilidades são idênticas?
Eu acho que sim, que há uma, mais especificamente a palavra HEART, mas este problema desencadeou discussões muito interessantes no meu Facebook, com a maior parte dos intervenientes a achar que as probabilidades são idênticas. Curiosamente, alguns alunos de Informática corroboraram a minha opinião, e chegaram mesmo a produzir simulações que o evidenciavam.
A razão para esta assimetria resulta do facto de as duas palavras dadas diferirem apenas da posição da letra H, e de uma tentativa para formar a palavra EARTH exigir que antes da letra E não esteja a letra H, enquanto que uma tentativa para formar a palavra HEART não tem qualquer restrição na letra que antecede o H.
Em média, em cada 26 tentativas para formar a palavra EARTH, há uma que acaba por formar a palavra HEART, que fica assim mais provável.
Acabo de fazer eu próprio uma pequena simulação com 100 jogos, tendo gerado 637431406 caracteres e tendo a palavra HEART ganho 52 vezes.
Deixo aqui o código mesmo muito elementar que usei

Espero que se divirtam...

segunda-feira, 13 de abril de 2015

Dois dados equitativos

O Público de ontem pergunta-nos se será possível numerar as faces de dois dados de modo que as somas das faces variem entre 1 e 12 e sejam todas igualmente prováveis.
Com dois dados normais, os 6x6 = 36 resultados possíveis não são igualmente prováveis. Basta listá-los todos e contá-los. Podemos utilizar um quadrado 6x6:


e chegaremos facilmente à distribuição de resultados


Facilmente se encontram contudo duas possibilidades de construir os tais dados equitativos:

 

em que é notório que a distribuição de resultados é uniforme. Qualquer resultado tem a probabilidade 1/12 de acontecer.
E até há uma solução em que um dos dados é o convencional. Quantas soluções diferentes haverá?