Posts

A simple R/Shiny app to illustrate two properties of means and medians

 Recently I saw two interesting discussions on Twitter that had to do with means and medians and the relationship between both. Both were in Dutch. The first one was between Casper Albers (@CaAl) and Zihni Özdil (@ZihniOzdil) about student loans (see here ). The bottomline is dat Casper Albers reminded us that a positive stochastic variable can never have a median that is more than twice the mean. The second discussion was between Joël De Ceulaer (@jdceulaer), Karel Anthonissen (@KAnthonissen),  Youssef Kobo (@Youssef_Kobo) and Koen Fillet (@filletk) about young people buying houses and the support they get from their parents (see here ). That discussion also involved means and medians.  I mentioned that if a distribution has a finite variance, the absolute value of the difference between mean and median is at most equal to the standard deviation  (see here ).  These two properties are not well know and suprising to some. I will admit that I only learned about t...

Opmerkingen bij kadering statistische resultaten van de Grote Coronastudie

Image
 Inleiding Enkele weken geleden hebben Thomas Neyens (UHasselt & KU Leuven), Jonas Crèvecoeur (UHasselt & KU Leuven), Niel Hens (UHasselt & UAntwerpen), Geert Molenberghs (UHasselt & KU Leuven), Koen Pepermans (UAntwerpen), Jan Aerts (UHasselt), Pierre Van Damme (UAntwerpen), Philippe Beutels (UAntwerpen) een lang verwachte kadering van de statistische resultaten van de Grote Coronastudie (GCS) gepubliceerd.  De eerste bladzijden lezen als een beknopte inleiding in kwantitatieve onderzoeksmethoden. Alleen daarom al, loont het de moeite om het stuk van Neyens, Crèvecoeur, Hens et al. (2021) te lezen. Met name voor niet-specialisten is dit zeer lezenswaardig. De auteurs slagen er in om in enkele paragrafen en in een eenvoudige taal wegwijs te maken in de verschillende onderzoeksmethoden.   Daarna wordt de GCS in dit kader geplaatst en van naderbij bekeken. Samengevat is de GCS is een observationele, niet-probabilistische survey die cross-sectioneel gebr...

Beware of the constrictive data science pyramid!

I tried writing on Medium. It features data science, constrictive pyramids and carpentry, but essentially it's about #HR in #Tech 😎. Here 's the result. Regards, Istvan

Tijd voor een noodsteekproef

Image
In De Morgen van 23 juni 2020 doet Paul De Grauwe een oproep om mondmaskers in alle publieke ruimtes waar de afstandsregel niet kan worden gerespecteerd te verplichten. Zijn pleidooi is gebaseerd op de observatie dat de aanbeveling die tot dan gold onvoldoende is gebleken.  Ik steun de oproep van De Grauwe volledig. Op 2 juli meldde De Morgen dat volgens de Grote Coronastudie van de universiteiten van Antwerpen, Hasselt en Leuven en de ULB, 77 procent van de Belgen mondmaskers wil verplichten in de supermarkt. Deze twee observaties zijn niet noodzakelijk tegenstrijdig. Het zou kunnen dat tussen 23 juni en 2 juli de publieke opinie veranderd is. Het zou ook kunnen dat  mensen het 'wederkerig altruïsme' argument van De Grauwe goed begrepen hebben en zich realiseren dat enkel verplichting mensen (inclusief zichzelf) zal aanzetten tot het dragen van een mondmasker. Een andere mogelijkheid is dat de observaties wel tegenstrijdig zijn en dat (minstens) één van de twee fout i...

Data Science trends

Wrote a LinkedIn article on the trends I see in data science. You can find it here .

Bespreking van - Het algoritme heeft u door - op Interne Keuken.

Image
Zoals velen luister ik graag naar het programma "Interne Keuken" op Radio 1 op zaterdag middag. Vorige week, op 5 mei 2018, was de literatuurwetenschapper Jos De Putter te gast over z'n interview met Michal Kosinski, één van de personages in het Facebook/Cambridge Analytica schandaal. Deze bijdrage kon me minder bekoren. In  deze blogpost leg ik uit waarom. Je kan het gesprek met Jos De Putter zelf terugvinden op  Interne Keuken . Het gaat al meteen goed fout na de inleiding wanneer Jos De Putter Michal Kosinski omschrijft als de grondlegger van de psychometrie en psychometrie definieert als de combinatie van psychologie en Big Data. Dus, voor alle duidelijkheid, psychometrie is een tak van de psychologie dat zich bezighoudt met de theorie en de  technieken van het meten van psychologische fenomenen zoals persoonlijkheidskenmerken, attitudes, enzovoort, en heeft op zich weinig te maken met Big Data. Francis Galton, een neef van Darwin overigens, wordt vaak als één van d...

(small) samples versus alternative (big) data sources

Image
Those of you who already have attended a meetup of the Brussels Data Science Community know that, besides excellent talks, those meetups are fun because of the traditional drinks afterwards. So after the last meetup we were on our way to a bar on the campus of the University of Brussels and I had this chat with @KrisPeeters from Dataminded. Now if you are expecting wild stories about beer and loose women (or loose men for that matter), I'm afraid I'll have to disappoint you. Instead we discussed ... sampling. Kris was questioning whether typical sample sizes market research companies work with (say in the hundreds or a few thousand at the max) still matter these days, given that we have other sources that give us much larger quantities of data. I told him everything depends on the (business) question the client has. To start with we can look at history to answer this question. In 1936 the Literary Digest poll had a sample size in the millions. But, obviously, that sample wa...