In geval van zeer grote afwijkingen, zoals de 1800 graden die Luc in zijn bericht noemt, zal dit algoritme falen.
Waarom? Als ik een willekeurige set van 300 waarnemingen tussen 18 en 30°C heb, en één waarneming van 1800°C, wordt die met 3 standaardafwijkingen er wel degelijk uitgefilterd.
Sterker nog, alles boven de 35°C wordt er altijd uitgefilterd (5°C boven de hoogste van de 'originele' set). Desnoods neem je vier standaardafwijkingen, dan wordt alles vanaf 38,5°C verworpen. In een normaalverdeling staat dit gelijk aan 99,99% (drie stdev is 99,7% bij normale verdeling). Het gaat vooral theoretisch nog mis als je een zeer brede verdeling hebt, maar dan is de mediaan ook vrij onbruikbaar (bovendien, stel dat je twee gelijke pieken hebt, _-|-_-|-_; de mediaan valt dan juist tussen de twee pieken in). Met 3x standaardafwijking verwerp je vrijwel altijd de outliers wel, ongeacht de exacte verdeling.
Download
hier mijn Excel sheet waarmee ik dit even snel getest heb

. Genereert 300 willekeurige waarden tussen 18 en 30°C, de verdeling daarbij is ook nog eens zelden Gaussisch. De foute waarde wordt desondanks altijd verworpen.
Gr. Ben
Quote selectie