חיפוש באתר

קישורים

עמודים

RSS סטטיסטיקה ברשת

תגים

בחירות ביוסטטיסטיקה בייסבול בנימה אישית בריאות גרפים דו"ח העוני דילמת האסירים הומור הומיאופתיה הימורים היסטוריה המשפטים הגדולים של הסטטיסטיקה הסתברות השכלה גבוהה חברה חידות חינוך חשבון יישומים כלכלה מדגם מדע מונטי הול מחקרים מירב ארלוזורוב ממוצע מצחיק משרד האוצר מתאם מתמטיקה ניהול סיכונים ניסויים קליניים סטטיסטיקה ספורט ספרים סקרים עיוות נתונים קבלת החלטות שכר שכר לימוד תאונות דרכים תורת המשחקים תקשורת p-value

"על חלל וחוצנים" עם דודי זוסימן

אחוז ניכר של האוכלוסייה מאמין שחלליות מאוכלסות בחייזרים המבקרים אותנו מדי יום.

מה ניתן לעשות כנגד תנועה שכזו? אילו כלים מציע לנו המדע לחקירת עדויות לכאורה כאלו? התשובות בהרצאתו של דודי זוסימן במפגש"ספקנים בפאב" הקרוב. הספקנות מוצגת במיטבה. ההרצאה תכלול סרטונים מדהימים של עב”מים המציתים את הדמיון!

דודי זוסימן, מהנדס חלל, כיום מנהל את תוכנית עמוס 4 ובעל ניסיון של מעל עשור בתחום לוויני החישה מרחוק והתקשורת בתחומי החלל הממשלתי והמסחרי. מנכ”ל "אגודת החלל הישראלית" וממייסדיה. חבר בוועד "העמותה לננו-לווינים בישראל" ומנהל פורום חלל ולווינים ב"תפוז".

המפגש ייערך בפאב "גורדו", בטיילת גורדון בתל-אביב, בתאריך 24 באוגוסט 2010, בשעה 20.00.

לאחר ההרצאה יתקיים דיון בנושא בהשתתפות המרצה.

דמי ההשתתפות: 10ש"ח בלבד לכיסוי עלויות האירוע. מספר המקומות מוגבל. הרשמו באתר http://www.skeptics.org.il

פרטים נוספים: באתר ספר סביר ובאתר שפינוזה.

לקריאה נוספת בנושאים הקשורים לנושא רשימה זו

מקבץ 4

שלום לכולם. הפעם מקבץ ארוך למדי, עקב משך הזמן הארוך מאז המקבץ הקודם.

  • השבוע צוינו 100 שנה למותה של פלורנס נייטינגייל.
  • בעיית המעטפות (עליה כתבתי לפני כשנתיים)  הרימה שוב את ראשה, הפעם בבלוג של וייאם בריגס, שהקדיש שתי רשימות לנושא. את הרשימה הראשונה אפילו קראתי. (המשך הפריט גולש לפרטים טכניים, אז מי שלא מעוניין מוזמן פשוט לדלג עליו). בתחילה בריגס מציג את החישוב השגוי לפיו החלפת המעטפות תביא לתוחלת רווח של 1.25X (כאשר  X הוא הסכום במעטפה שקיבלת), ולכן מתקבלת המסקנה הפרדוקסלית לפיה כדאי להחליף את המעטפה שוב ושוב ושוב. אולם בריגס אינו מסיק מכך כי יש לנסות לערוך את החישוב בצורה נאותה יותר. המסקנה של בריגס היא שיש להשליך את התוחלת לכל הרוחות בבעיות החלטה (טוב, הוא השתמש במלים קצת יותר מעודנות). וכיוון שכך, הוא פונה מייד אל העולם הבייסיאני (הבייסיאניים לא משתמשים בתוחלת? אלה חדשות אפילו בשבילי), ומתחיל להציג שלל פתרונות מהסוג שגרמו לי לא להתלהב מהענף הזה של הסטטיסטיקה. עלי לציין כי הגבתי לרשימה וציינתי מהיכן מגיע הפרדוקס, ומדוע תוחלת הרווח מהחלפת המעטפות היא אפס (ולכן לא משנה אם מחליפים או לא). בתגובה בריגס דרש ממני "להוכיח" (?!) כי החישוב שלו לפיו התוחלת היא 1.25X אינו נכון. אני לא מבין את זה. הוא הוא יטען כי 2 ועוד 2 שווים ל-5 ואני אטען כי התשובה הנכונה היא 4 (למניעת תשובות מתחכמות – אני מדבר על שדה הממשיים), האם אדרש להוכיח כי התשובה 5 אינה נכונה? בריגס הוסיף וטען כי התוחלת הוא מושג שכיחותי (frequentist) ואילו ניסוי המעטפות נערך פעם אחת בלבד, ולכן מושג התוחלת אינו תקף. אני לא מבין את הטיעון הזה. ואם נערוך סדרה של ניסויים זהים, אז הטיעון שלי יהיה תקף לפתע? אשמח למי שיאיר את עיניי. את הרשימה השניה של בריגס כבר לא קראתי, אבל אתם מוזמנים.
  • נתן יאו מהבלוג Flowing Data העוסק בויזואליזציה של נתונים כתב רשימה על 7 הכללים הבסיסיים ליצירת גרפים ותרשימים. 7 הכללים הם: בדוק את הנתונים, הסבר את הקידוד, הוסף תוויות לצירים, ציין את יחידות המדידה, שמור על פרופרציות גיאומטריות נכונות, ציין את מקור הנתונים, וזכור מי קהל היעד שלך. כעת פוצח יאו בסדרה של שבע רשימות שתסביר ביתר פירוט את כל אחד מהכללים. הנה הלינק לרשימה הראשונה בסדרה: בדוק את הנתונים.
  • שמוליק הביא בבלוג שלו דוגמא בה הכלל החמישי של יאו מופר בגסות.
  • והנה הצגה גרפית יפה (בוושינגטון פוסט) המשווה בין תכניות המס של שני נשיאי ארה"ב האחרונים, בוש ואובאמה.
  • רנדום ג'ון מדווח על הרצאה של פרנק הארל בכנס useR!  שעסקה ב"אלרגיה לאינפורמציה". תופעה זו באה לידי ביטוי בהתנגדות להשיג אינפורמציה הדרושה לקבלת החלטה נכונה ובהתעלמות מאינפורמציה חשובה וזמינה. הוא מביא לינק למצגת של גירסה יותר ישנה של ההרצאה.
  • ועוד דיווח מכנס: ג'ון ג'ונסון מחברת קאטו מדווח על התובנות שלו מכנס JSM2010 שנערך בואנקובר בתחילת החודש.
  • למתעניינים בכריית נתונים (שלאחרונה הצטרפתי לשורותיהם): ג'ון אלדר כותב על עשרת הטעויות האפשריות הגדולות ביתר בדאטה מיינינג. כשערך את ספירת המלאי גילה שיש לו למעשה 11 טעויות ברשימה. הפתרון שלו: הן דורגו החל מ-0 ועד 10. זה לא רעיון מקורי. גם בליגת המכללות הנקראת "Big10" יש 11 מכללות (שימו לב ללוגו).
  • וזה לא שייך למקבץ, אבל הפריט הקודם הזכיר לי אנקדוטה על המתמטיקאי נורברט ווינר, אולי האבטיפוס של דמות הפרופסור המפוזר. באחת הפעמים שעבר דירה, ביקשה ממנו אשתו לברר כי אל הדירה החדשה הגיעו 10 מזוודות. ווינר חזר ודיווח לרעייתו כי ספר 9 מזוודות בלבד, והדגים בנוכחותה את הספירה החוזרת: 0, 1, 2,…
  • כריסטיאן רוברט (Xian) מאוניברסיטת דופין בפריז החליט להעביר סמינר על המארים הקלאסיים של הסטטיסטיקה. כדי להחליט אלו מאמרים ילמדו בסמינר, הוא ערך סקר בין קוראי הבלוג שלו. בין המועמדים: מאמרם הקלאסי של ניימן ופירסון, מאמרו של ברדלי אפרון (מספר 8 ברשימת 15 הסטטיסטיקאים הגדולים שערכתי), מאמרו של קוקס (מספר 10) על ניתוח השרדות, ועוד רבים וטובים. בולטים בהעדרם מהרשימה  מאמר כלשהו מאת פישר (עליו כתבתי כאן רבות, הקישור לביוגרפיה קצרה שכתבתי עליו בפורום מתמטיקה של התפוז) ומאמרו של בייס (עליו כתבתי ברשימה "הכוכב, הסמים והכומר"). כשצפיתי בתוצאות הסקר הופתעתי: המאמר של ניימן ופירסון הגיע רק למקום החמישי, אותו הוא חולק במשותף עם מאמרו של הייסטינגס על שיטת MCMC. למקום הראשון הגיע מאמרו של אפרון על שיטת הבוטסטרפ; במקום השני: דמפסטר, ליירד ורבין במאמרם על שאלגוריתם EM. שלישי היה מאמרו של רוברט טיבשירני על שיטת הלאסו, ובמקום הרביעי – ישראל על המפה: מאמרם של יוסי הוכברג ויואב בנימיני מאוניברסיטת תל אביב על גישת ה-FDR  לבדיקת השערות מרובות.
  • תמר בן יוסף כותבת על התייקרות הדירות בישראל, ובפרט על הקשיים והכשלים במדידת מחירי הדירות.
  • בבלוג עבודה שחורה כותב יפתח גולדמן על סקר שערך משרד התמ"ת אודות התפלגות השכר בישראל ומסקנתו: התפלגות השכר מוּטה, והשכר הממוצע לא מייצג את התפלגות השכר במשק. קוראי הבלוג הותיקים, שקראו את רשימתי על המנהל והפועלים, בודאי לא מופתעים.

לקריאה נוספת בנושאים הקשורים לנושא רשימה זו

הודעה: הרצאה בפטיבל אייקון

אייקון TLV, הפסטיבל הבינלאומי למדע בדיוני ופנטזיה, נערך מדי שנה בתל אביב בחול המועד סוכות.

במסגרת הפסטיבל שייערך השנה, אתן הרצאה על ההיסטוריה של הניסויים הקליניים, נושא שהיה בבחינת מדע בדיוני בהיסטוריה הלא ממש רחוקה שלנו. ההרצאה תתבסס על הרצאה "מהלימון ועד הקופקסון" שנתתי לפני כחצי שנה, אולם ההדגשים יהיו שונים, בהתאם לקהל היעד.

פרטים על מועד ההרצאה יפורסמו בקרוב באתר הפסטיבל וגם כאן.

לקריאה נוספת בנושאים הקשורים לנושא רשימה זו

כמה מצלמות אבטחה יש בבריטניה?

הנושא ישן (כפי שהתברר לי). הגעתי אליו משני כיוונים שונים. במגזין כלכליסט מהשבוע שעבר הובא ראיון עם נביא זעם בשם ג'ון קמפנר, שדן ב-"עיסקה הפופולרית בעולם", לדבריו, "במסגרתה אנחנו מוכרים את כל החירויות שלנו רק כדי לשמור על החופש להרוויח". דבריו של קמפנר אכן מעוררים מחשבה, וראויים לדיון נפרד, אבל אני רוצה להטפל רק לדוגמא אחת שהובאה בכתבה (כנראה על ידי הכתב אורי פסןבסקי, ולא על ידי קמפנר עצמו). בבריטניה, נטען, יש כ-5 מליון מצלמות אבטחה, מצלמה אחת לכל 12 תושבים. האח הגדול כבר כאן.

הידיעה הזו אינה חדשה. כבר ביולי 2008 דיווח יוסי גורביץ בכלכליסט כי "4.2 מיליון מצלמות במעגל סגור מותקנות בבריטניה, מצלמה על כל 14 תושבים". עברו שנתיים, נוספו עוד 800,000 מצלמות. נשמע הגיוני.

לנושא הזה הגעתי גם מכיוון אחר לגמרי. בכנס בואנקובר בו הייתי בשבוע שעבר חילקה הוצאת וויילי חוברות ישנות של המגזין Significance , שמוציאה לאור האגודה המלכותית לסטטיסטיקה (החל מהחודש, בשיתוף עם האיגוד האמריקני לסטטיסטיקה, וכך נעשיתי למנוי על המגזין). בחוברת של דצמבר 2009 הובאה כתבתה של אליס טרלטון  מערוץ 4 של ה-BBC, שכותרתה: "כמה מצלמות אבטחה?". הכתבה זכתה בפרס למצויינות סטטיסטית בעיתונות המוענק על ידי האגודה המלכותית לסטטיסטיקה. הלינק האחרון מוביל לכתבה באתר של ערוץ 4. אני אתאר מייד את עיקר הממצאים.

ובכן, איך הגיעו למספר של 4.2 מליון מצלמות אבטחה?

הכל התחיל במאמר שפרסמו ביוני 2002 שני חוקרים (קישור לקובץ pdf), מייקל מקהייל מאוניברסיטת האל וקלייב נוריס מאוניברסיטת שפילד. כל מה שצריך זה לקרוא את המאמר, וזה בדיוק מה שעשתה טרלטון. החוקרים סקרו שני רחובות מרכזיים בלונדון: Putney High Street (פוטני) ו-Upper Richmond Road (ריצמונד). הם דגמו 211 בתי עסק בשני הרחובות, ומצאו כי ב-41% מהם מותקנות מצלמות אבטחה, ובממוצע יש בכל מערכת 4.1 מצלמות. בלונדון יש כרבע מליון בתי עסק. הכפלה של 3 מספרים נתנה תוצאה של כ-422 אלף מצלמות. למספר זה הוסיפו החוקרים את הערכתם למספר המצלמות הנמצאות באזורים ציבוריים : רחובות, תחבורה ציבורית, בתי חולים וכו'. הם העריכו את מספרן של מצלמות אלה (והשתמשו בפירוש במילה "guesstimate" – שילוב של אמדן וניחוש) בכ-80 אלף, וכך הגיעו למספר כולל של כחצי מליון מצלמות בלונדון. ומכיוון שבלונדון יש כ-7 מליון תושבים, המסקנה היא שיש בלונדון מצלמת אבטחה אחת לכל 14 תושבים. ואם זה בלונדון, זה גם בכל בריטניה, לא?

אז זהו, שלא.

קודם כל, יש לשים לב לשונות בין שני הרחובות שנסקרו. ברחוב פוטני נמצאו מצלמות ב-49% מבתי העסק, בריצמונד ב-34% בלבד. ייתכן כי רחוב ריצמונד הוא המייצג את המצב בלונדון, ואז נופלת הערכת מספר המצלמות בלונדון ב-30%, ל-350 אלף מצלמות בלבד. מצד שני, ייתכן כי דווקא רחוב פוטני הוא המייצג, ואז ההערכה של מצלמה ל-14 תושבים היא הערכת חסר. מה שיותר סביר הוא ששני הרחובות האלה גם יחד אינם מהווים מדגם מייצג מספיק. קל לברר, וטרלטון עשתה זאת, כי תמהיל העסקים בשני הרחובות האלה שונה מהותית מתמהיל העסקים הכללי בלונדון. ה"מדגם" לא ממש מייצג. מה ששני החוקרים קיבלו הוא לכל היותר הערכה של מספר המצלמות בשני הרחובות שסקרו (בהנחה שמדגם בתי העסק שלקחו ברחובות האלה היה מייצג). האקסטרפולציה שעשו משם אל לונדון, ואח"כ אל כל הממלכה המאוחדת, לא ממש ולידית.

טרלטון מצאה דרך אחרת להעריך את מספר מצלמות האבטחה בבריטניה. היא פנתה אל קבוצת משתמשי מצלמות האבטחה בבריטניה. הם הודו שהם לא יודעים את המספר המדויק, אך העריכו (שוב guesstimate) כי מספרן הוא לא יותר ממליון ורבע בכל בריטניה.

לקריאה נוספת בנושאים הקשורים לנושא רשימה זו

ואנקובר – סיכום הכנס

הכנס נגמר היום (כאן עדיין יום חמישי), ורגע לפני הטיסה חזרה לארץ, הנה סיכום של הצד המקצועי של הכנס.

יום ראשון

היום הזה היה אמור להיות מוקדש כולו לקורס בכריית נתונים (data mining). הקורס היה מאכזב מאוד. שלושת המרצים עברו על השקפים שהכינו במהירות הבזק, אבל גרוע מכך – לא ממש תרמו לידע שלי. הם הקדישו זמן רב להסברים מדוע הנושא חשוב (אני יודע שזה חשוב, אחרת לא הייתי נרשם לקורס הזה), הרבה באזוורדס עפו באוויר, והוקדש המון המון זמן לרגרסיה לוגיסטית. רגרסיה לוגיסטית! זה קורס לסטטיסטיקאים מקצועיים, כמעט כולם בעלי תואר שני לפחות, אם לא שלישי. ציפיתי למשהו יותר מתוחכם. רגרסיה לוגיסטית אני יודע מהבית. לפני היציאה להפסקת צהריים הודיע המרצה הראשי כי סקירת החומר של הקורס הסתיימה, ושאר זמן הקורס (אחרי ההפסקה) יוקדש להדגמה של תוכנות שונות, "בעיקר SAS". ויתרתי על ההמשך. הייתי צריך לדרוש את כספי בחזרה.

מעז יצא מתוק. אחרי הצהריים הלכתי לשמוע מושב הרצאות בנושא אמידת משך חיי המדף (כלומר תאריכי התפוגה) של תרופות, תחום שאני עוסק בו רבות. המושב התחיל בסקירה של השיטה הנוכחית לקביעת תאריך התפוגה המוכתבת על הרשויות הרגולטריות, והבעייתיות שבשיטה זו. הבעיה העיקרית היא שהשיטה הנוכחית נותנת אמדן חסר של משך חיי המדף, ובמלים אחרות – חלק גדול מהתרופות עדיין טובות לשימוש זמן רב (בחלק מהמקרים שנים רבות) אחרי שעבר תאריך התפוגה הרשמי שלהם. זה אולי טוב לרשויות, אבל רע לכל השאר: לחברות התרופות, לצרכנים באופן ישיר, ולמי שמממן את העלויות של השלכת תרופות טובות לפח: חברות ביטוח, קופות חולים, ממשלות – וחלק נכבד מהעלויות האלה שוב מתגלגלות לצרכנים. בהמשך הוצגו דרכים בהם מנסים להתמודד עם הבעיה (שיחות בין חברות התרופות לרגולטורים), ושיטות סטטיסטיות חדשניות להערכת תאריכי התפוגה.

משם המשכתי למושב שעסק בתכנון ניסויים קליניים שלב I, המיועדים לזיהוי המינון המקסימלי האפשרי של תרופה חדשה (מה שנקרא בז'רגון MTD, ראשי תיבות של Maximal Tolerated Dose). היה מעניין למדי, זה תחום שאני לא ממש עוסק בו ולכן גם לא מתמצא.

יום שני

את היום הזה התחלתי  בהרצאת סקירה שנשאה את הכותרת היומרנית "כיוונים עתידיים בניתוח נתוני גנום". ההרצאה הייתה מאכזבת. שני מרצים עם מבטאים נוראיים (אוסטרלי וסיני), שנתנו מצד אחד סקירה בסיסית ביותר של מבנה הגנום והדנ"א, התעכבו רבות על פרטים טכניים הקשורים לטכניקות של sequencing, ולא ממש פירטו מהם הכיוונים העתידיים. אה. הם אמרו שהמטרה היא לזהות גנים הקשורים למחלות.

המושב השני של אותו יום היה מושב לזכרו של הסטטיסטיקאי ג'ק גוּד (Good), שנפטר לפני מספר חודשים בגיל 91. שמעתי את שמו פעם, אולם לא הכרתי את עבודתו. הלכתי לשם בעיקר בגלל שאחד הדוברים היה סטיב פיינברג, שאת ספריו על ניתוח נתונים קטגוריים קראתי בשקיקה בצעירותי. מהר מאוד הבנתי למה לא הכרתי את פועלו של גוּד. הוא היה סטטיסטיקאי בייסיאני, ולא סתם סטטיסטיקאי בייסיאני, אלא אחד המייסדים של האסכולה, ולדידו אין סטטיסטיקה אחרת מלבד הבייסיאנית. שלושה מהמרצים היו חברים של גוּד (גוּד היה גם מדריך הדוקטורט של אחד מהם), והם סיפרו אודות עבודתו וחייו. הופתעתי, למשל, לגלות כי גוּד היה עבד בצוותא עם אלן טיורינג ביחידת פענוח הצפנים בבלצ'לי פארק במהלך מלחמת העולם השניה. ההרצאות היו מרתקות. אני בהחלט מתכוון לנסות להכיר עוד את האיש ופועלו, ואולי גם לקרוא את אחד מספריו.

אחר הצהריים הייתי במושב שעסק בתכנון וניתוח של ניסויי bioassay. ההרצאות היו טכניות מאוד, אבל בהחלט לא משעממות (זהו עוד תחום שאני עוסק בו, אז אני קצת משוחד).

יום שלישי

כל היום הזה הוקדש לקורס על שיטות לניתוח ניסויי Genome-Wide Association, הידועים בשמם המקוצר GWAS. הקורס היה מצויין. ההסברים על הרקע הביולוגי היו בהירים ולא-טכניים. המרצים הסבירו היטב את כל השיטות הסטטיסטיות הבסיסיות (שאני מכיר חלקית), ודנו בהרחבה במגוון שיטות לניתוח נתונים קטגוריים (שהן הלחם והחמאה של הקורס). גירדתי את החלודה מהידע שלי בתחום והופתעתי לגלות שאני עדיין זוכר לא רע את העקרונות (הדוקטורט שלי עסק בניתוח נתונים קטגוריים, ופעם שלטתי היטב ברזי המודלים הלוג-לינאריים). התחום גם התפתח מאז שסיימתי את הדוקטורט (לפני כמעט 15 שנה), ושמחתי לראות חלק מההתפתחויות בתחום – כולל גישות בייסיאניות. אני לא מגדיר את עצמי כסטטיסטיקאי בייסיאני, אבל בהחלט מוכן לנסות את השיטות האלה, מה גם שהמרצה שהציג את השיטת האלה נתן הצדקות טובות לשימוש בהן.

יום רביעי

המושב הראשון בו הייתי היה מושב לזכרו של אריק להמן, שנפטר לפני 11 חדשים, בגיל 92. אלמנתו של להמן, ג'ולי שפר, סטטיסטיקאית בזכות עצמה, סקרה את תרומותיו של בעלה לתחום ההשוואות המרובות, והראתה כיצד עבודותיו משנות החמישים של המאה הקודמת, שנדחקו מאוחר יותר לשוליים עם התקדמות המחקר בתחום, חזרו ונעשו רלוונטיות בשנים האחרונות לאור התקדמויות נוספות במחקר (בייחוד עלייתה של שיטת ה-FDR). פיטר ביקל, תלמידו של להמן ואחר כך עמיתו באוניברסיטת ברקלי, סקר את עבודתו לאורך השנים. את המושב נעל פרסי דיאקוניס, בהרצאה נפלאה על חשיבותו של המחקר בתיאוריה הסטטיסטית.

בחלק השני של הבוקר נכחתי במושב טכני אך חשוב שעסק בשיטת לניטור ניסויים קליניים.

את אחר הצהריים ביליתי באופן לא צפוי לחלוטין: הלכתי למושב שעסק בשיטות בייסיאניות לפיתוח פרמצבטי ומחקרים קליניים. ללא ספק, המושב לזכרו של גוּד והשיטות הבייסיאניות לניתוח נתונים קטגוריים אליהן נחשפתי ביום שלישי השפיעו עלי. היה מעניין.

יום חמישי

היום האחרון של הכנס – בו היו שני מושבים בלבד (הכנס ננעל בצהריים). המושב בראשון עסק בעוד תחום בו אני עוסק רבות – חישוב והערכה מחדש של גדלי מדגם (כתבתי על כך לפני כשנה). המושב השני של הבוקר עסק ב-GWAS, ובו הוצגו כמה מחקרים חדשים בתחום.

לקריאה נוספת בנושאים הקשורים לנושא רשימה זו