ארכיב עבור תגית ניסויים קליניים
מבט להיסטוריה של הניסויים הקליניים
רשימה זו נכתבה בעקבות המפגש האחרון של קבוצת הדיון בהיסטוריה של הסטטיסטיקה שעסקה בניסויים קליניים. אציין כי אני הוא שהעלה את הנושא לדיון, והייתי אחראי לאיסוף והפצת חומר הקריאה למפגש. חלק מהחומרים שנקראו כבר סקרתי בעבר בהרצאה "מהלימון ועד הקופקסון" שנתתי במסגרת "ספקנים בפאב" (ואפשר לצפות בהקלטתה על ידי לחיצה על הקישור). רשימה זו כוללת סקירה היסטורית קצרה של חמשת הניסויים הקליניים שנדונו.לאחר הסקירה ההיסטורית שנתתי נערך דיון מעניין שעסק בהיסטוריה ובפילוסופיה של המדע, ובהשפעות של בייקון ומיל על התפתחות השיטה המדעית והשתקפותם בתהליך התפתחות הניסויים הקליניים. למרבה הצער, לא הצלחתי לארגן את ההערות שרשמתי לעצמי בזמן הדיון לטקסט קוהרנטי שאני יכול לפרסם כאן.
הניסוי הראשון הוא ניסוי הצפדינה של ג'יימס לינד, שנחשב בעיני רבים לנקודת ההתחלה של הרפואה המודרנית. זהו הניסוי הקליני המבוקר המתועד הראשון (( 1. אם מתעלמים מפרק א' של ספר דניאל )). לינד ערך ניסוי לבדיקת טיפולים אפשריים למחלת הצפדינה, גורם המוות העיקרי בקרב מלחים עד סוף המאה ה-18. (( 2. 2 מתוך כל 3 מלחים לקו במחלה ומתו. במלחמת 7 השנים בין אנגליה לצרפת, 1512 מלחים אנגלים נהרגו בקרבות, כ-100,000 מתו מצפדינה. )). בניסוי שנערך בהפלגה קצרה יחסית בים התיכון בשנת 1749, חילק לינד את 12 המלחים שחלו בעת ההפלגה לשש קבוצות שוות. כולם שוכנו באותו מקום בספינה וקיבלו תפריט זהה, שנבדל רק בטיפול הניסיוני שניתן להם. הטיפולים היו: שתיית ליטר סיידר ביום, שתיית 25 טיפות חומצה גופרתית 3 פעמים ביום, שתיית שתי כפות חומץ 3 פעמים ביום, שתיית חצי ליטר מי ים ביום, משחה שהוכנה משום, חרדל, צנון ושרף, או אכילת שני תפוזים ולימון ביום. המטופלים בפירות הדר החלימו כליל, ובמצבם של המטופלים בסיידר חל שיפור קל. ההשוואה בין הקבוצות אפשרה ללינד להעריך את יעילותו של כל טיפול ביחס לאלטרנטיבות הטיפוליות האחרות.
ציון הדרך הבא הוא סדרת הניסויים של וויליאם ווטסון לבחינת טיפולים להפחתת הסיכון במחלת האבעבועות השחורות. כבר במאה ה-11 היה ידוע כי מי שחלה במחלה זו ושרד לא יחלה בה שוב. עקב כך התפתחה פרקטיקה של מעין חיסון למחלה על ידי "הדבקה קלה" של אנשים בריאים במחלה. עם זאת, בין הרופאים היו מחלוקות בדבר אופן ההדבקה האופטימלי ובדבר טיפול נלווה להדבקה. ווטסון ערך סדרה של שלושה ניסויים קליניים בבית החולים לילדים בלונדון בשנת 1767 (( 3. Boylston, A. W. (2002). Clinical investigation of smallpox in 1767.New England Journal of Medicine, 346(17), 1326-1328. )). המתודולוגיה שלו הייתה דומה לזו של לינד: הילדים המשתתפים בכל ניסוי חולקו לקבוצות, ובכל קבוצה בוצעה בנבדקים "הדבקה מבוקרת" על ידי שימוש בשלפוחית משלב מוקדם של המחלה. לכל קבוצה ניתן טיפול נלווה אחר שהיה אמור להפחית את הסיכון בהדבקה. בתכנון הניסויים של ווטסון יש מספר חידושים לעומת הניסוי של לינד. ווטסון דאג כי בכל קבוצת טיפול יהיה מספר שווה של בנים ובנות, כדי למנוע הטיה אפשרית למקרה שהתגובה לטיפול שונה בין המינים. כמו כן, קבוצה אחת בכל ניסוי לא קיבלה טיפול נלווה אלא שימשה כקבוצת ביקורת. והחשוב מכל: ווטסון היה הראשון שהנהיג מדידה כמותית של התוצאות. המדד להצלחת הטיפול היה מספר האבעבועות שהופיעו בכל ילד שהשתתף בניסוי. הוא אף ערך ניתוח סטטיסטי בסיסי ופרסם את ממוצע מספר השלפוחיות לילד בכל קבוצה. מסקנתו של ווטסון הייתה כי הטיפולים המקובלים להפחתת הסיכון, שכללו כספית, צמחים שונים ומיני משלשלים, לא הביאו להקלה בחומרת ההדבקה בהשוואה למודבקים שלא קיבלו טיפול נלווה.
נקודת הציון המשמעותית הבאה היא ניסוי החלב במחוז לאנרקשיר בסקוטלנד בראשית המאה ה-20 (( 4. Leighton G, McKinlay P (1930). Milk consumption and the growth of school-children. Department of Health forScotland, Edinburgh and London: HM Stationery Office. )). מטרת הניסויים היה לבדוק האם הזנה יומית בחלב משפרת את הגדילה של ילדים (וילדות) בהשוואה לילדים שלא שתו חלב על בסיס יומי, וכן לבדוק האם יש הבדל בשיעורי הגדילה בין ילדים שהוזנו בחלב טרי ובין אלה שהוזנו בחלב מפוסטר. הניסוי, שנערך ב-1930 היה רחב היקף וכלל בסך הכל כעשרים אלף ילדים בגילאי 6-12, שלמדו ב-67 בתי ספר. כ-5000 הוזנו בחלב טרי, כ-5000 בחלב מפוסטר, וכ-10000 ילדים שויכו לקבוצת הביקורת. גובהם ומשקלם של הילדים נמדדו בתחילת הניסוי (פברואר 1930) ובסופו (יוני 1930). המסקנה הייתה כי תזונה יומית של חלב משפרת את גדילת הילדים, וכי אין הבדל משמעותי בין חלב טרי לחלב מפוסטר. כמו כן הסיקו החוקרים כי אין השפעה לגיל הילדים על האפקט של קצב הגדילה.
ניסוי זה נכנס לרשימה שלי דוקא בשל הביקורת שהוטחה בו. עם המבקרים נמנו פישר ובארטלט, אולם את הביקורת המקיפה ביותר הטיח "סטודנט", הלא הוא ויליאם סילי גוסט. במאמר שפרסם בכתב העת ביומטריקה (( 5. Student (1931). The Lanarkshire Milk Experiment. Biometrika 23:398-406. )) קבע למעשה סטודנט כללים שקיומם הכרחי להבטחת התקפות של ניסוי קליני:
- סטודנט מעיר כי בכל בית ספר בניסוי הוזנו הילדים המטופלים בחלב טרי או בחלב מפוסטר, אך לא הייתה נציגות לשתי הקבוצות יחד באף בית ספר. עקב כך, אין אפשרות להשוות באופן ישיר בין חלב טרי ומפוסטר, עקב הבדלים בין בתי הספר השונים.
- שיוך התלמידים בניסוי לקבוצת הטיפול (הזנה בחלב או ביקורת) נקבע על ידי המורים בכל כיתה ולא באופן רנדומלי. עקב כך, נוצר מצב בו התלמידים בקבוצת הביקורת היו גדולים יותר במימדי גופם לעומת התלמידים בקבוצות הטיפול.
- המדידות נערכו בפברואר ויוני. בגדי חורף הינם כבדים יותר מבגדי אביב/קיץ, והבדל המשקל בין הבגדים קיזז את ההבדלים במשקל האמיתי. החוקרים הניחו כי ההבדל במשקל הבגדים יהיה דומה בין הקבוצות, אולם סטודנט טען כי יש ההטיה בחלוקת התלמידים לקבוצות מושפעת ממצבם הכלכלי – תלמידים ממשפחות אמידות הוכללו בדרך כלל בקבוצות הביקורת – הביאה לכך שמשקל בגדי החורף של קבוצת הביקורת יהיה גבוה יותר.
סטודנט הסיק לכן כי התוצאות שהתקבלו לא תומכות בטענה כי אין הבדל בין תזונה בחלב טרי ותזונה בחלב מפוסטר, וגם כי אי אפשר להסיק שאין קשר בין הגיל ובין השינוי בקצב הגדילה. הוא מזכיר גם את הניתוח של פישר וברטלט (( 6. Fisher RA, Bartlett S (1931). Pasteurised and raw milk. Nature 127:591-592. )) המראה כי לחלב טרי יתרון על חלב מפוסטר באשר לקצב הגדילה.
סטודנט הביא גם מספר המלצות, ובהן הצעה לערוך את הניסוי באוכלוסיה של תאומים, כאשר אחד התאומים יוזן בחלב והשני ישמש כביקורת (או שאחד מהם יוזן בחלב טרי והשני בחלב מפוסטר לצורך השוואה בין שני סוגי החלב). אני סבור כי תכנון כזה לא מקובל בימינו מבחינה אתית, המלצה יותר מעשית היא לנתח מחדש את הנתונים שנאספו כדי לנסות להתגבר על ההטיה שנוצרה בהקצאה הלא רנדומלית לקבוצות טיפול וביקורת. ההמלצה האוטינטיבית שלו היא לערוך מחדש את הניסוי, תוך כדי הקפדה על רנדומיזציה, לקיחה בחשבון של הטיה עקב משקל הבגדים שלובש כל תלמיד, ותכנון הניסוי כך שבכל בית ספר יהיה ייצוג לשלוש קבוצות הטיפול.
ההמלצה העיקרית של סטודנט, להקפיד על הקצאה רנדומלית של המטופלים לקבוצות, לא התקבלה מייד, שכן רעיון זה נתפש בעיני חלק מהקהילה המדעית כ-"לא אתי". יש לציין כי עקרון הרנדומיזציה רק הוצג על ידי פישר ב-1923, ועדיין לא הייתה הכרה מספקת בחשיבותו. הניסוי הקליני הראשון עם הקצאה רנדומלית לקבוצת טיפול ולקבוצת ביקורת נערך רק ב-1947, והוא הרביעי ברשימה שלי. מדובר בניסוי לבדיקת היעילות של אנטיביוטיקה מסוג סטרפטומיצין לטיפול בדלקת ריאות (( 7. Medical Research Council Streptomycin in Tuberculosis Trials Committee. (1948). Streptomycin treatment for pulmonary tuberculosis. BMJ, 2, 769-82. )). עקב המחסור באנטיביוטיקה, לא הייתה ברירה אלא להחליט על ידי ביצוע "הגרלה" בין החולים מי יקבל טיפול ומי לא, וכך התגבר תכנון הניסוי על המחסום האתי. עם זאת, הניסוי לא היה כפול סמיות (Double Blind), ולא נעשה שימוש בפלסבו כטיפול דמה לקבוצת הביקורת, (( 8. Hart, P. D. A. (1999). A change in scientific approach: from alternation to randomised allocation in clinical trials in the 1940s.BMJ, 319(7209), 572-573. )) וזאת למרות שכבר היה תקדים לקיום ניסוי כזה: הניסוי הקליני הראשון שנערך בשיטת הסמיות הכפולה נערך כבר בשנת 1943 לבדיקת היעילות של פניצילין כטיפול להצטננות. החולים המטופלים לא ידעו האם הם שויכו לקבוצת טיפול ואכן טופלו בפניצילין, או שמא שויכו לקבוצת הביקורת וטופלו בפלסבו. גם הרופאים שטיפלו בחולים לא ידעו מהו הטיפול שקיבל כל חולה. תכנון כזה מונע הטיה שעלולה לנבוע מדיעה קדומה של הרופאים לגבי יעילות הטיפול, ולמעשה מכריח אותם לתת חוות דעת אובייקטיבית לגבי המצב הרפואי של החולה המטופל. עם זאת, בניסוי זה לא נערכה הקצאה רנדומלית של החולים לטיפול או ביקורת.
הויכוח בדבר חשיבות העקרונות שהתוו סטודנט ופישר הסתיים סופית בניסוי לבדיקת יעילות החיסון של סאלק נגד נגיף הפוליו, שנערך ב-1954 (( 9. Meier, Paul. "Polio trial: an early efficient clinical trial." Statistics in medicine 9.1‐2 (1990): 13-16. )). למעשה נערכו שני ניסויים. הניסוי שבראשו עמד הסטטיסטיקאי פול מאייר היה ניסוי כפול סמיות בהקצאה רנדומלית, והוא הראה ירידה של 70% במקרי השיתוק עקב פוליו בקבוצת הטיפול לעומת קבוצת הביקורת. גודל המדגם הגדול (כ-400 אלף ילדים בגילאי 6-8) סייע לביסוס התקפות החיצונית של התוצאות. במקביל נערך ניסוי נוסף, בו הקצאת הטיפול (חיסון או פלסבו) לא הייתה רנדומלית. 725,000 תלמידי כיתות א ו-ג שהשתתפו בניסוי שימשו כקבוצת ביקורת, ואליהם צורפו גם 125,000 ילדים מכיתות ב' שהוריהם סירבו לחיסון. נתוניהם הושוו עם הנתונים של 225,000 תלמידי כיתות ב' שהוריהם הסכימו לחסנם. סה"כ השתתפו בניסוי מעל מליון תלמידים, כמעט פי 3 מגודל הניסוי של מאייר. ניסוי זה הראה ירידה של 44% בלבד בשיעור מקרי השיתוק עקב פוליו, ואולם התברר כי האפקט הוקטן עקב הטיה הקשורה למצב הסוציו-אקונומי של קבוצת הטיפול. ילדי קבוצת הטיפול הגיעה ממשפחות אמידות יותר, ובשכבת אוכלוסיה זו שיעור מקרי השיתוק עקב פוליו היה גבוה יותר מכיוון ששיעור הילדים המחוסנים טבעית (חלו בפוליו באופן קל והחלימו ללא תיעוד) הינו נמוך יותר עקב רמת הסניטציה הגבוהה יותר בסביבתם. המקרה של ניסוי הפוליו הוכיח כי גודל המדגם אינו בהכרח הפרמטר החשוב ביותר בניסוי הקליני (( 10. ראו גם את הרשימה בחירות 1936 – המנצח שלא היה, שעסקה במקרה מפורסם אחר בו מדגם גדול לא הצליח לחזות את המנצח בבחירות לנשיאות ארצות הברית עקב הטיה בתכנונו)), וכי רק הקצאה רנדומלית וסמיות כפולה מבטיחים את התקפות הפנימית של הניסוי.
נשלח: 24 ביוני, 2014. נושאים: ביוסטטיסטיקה, האנשים שמאחורי הסטטיסטיקה, היסטוריה, מדע, ספקנות.
תגובות: 4
| טראקבק
ניסוי קליני מתוכנן היטב לבדיקת תכשיר הומיאופתי – ניתוח מקרה
אני מקווה שרוב קוראיי (כלומר, לפחות ארבעה!) מכירים את הבלוג “חשיבה חדה" שכותב ידידי גלעד דיאמנט, ו/או את קבוצת הפייסבוק הקשורה אליו. אם לא זו ההזדמנות לערוך היכרות. אני פותח המלצה על הבלוג והקבוצה, משום שדיון בקבוצה הוביל אותי לכתיבת הרשימה הנוכחית.
הכל התחיל בלינק לידיעה על יצרנית תכשירים הומיאופתיים שנאלצה לקרוא להחזרת חלק ממוצריה בגלל שהכילו אנטיביוטיקה (אופס). בדיון שהתפתח, כתב אחד מחברי הקבוצה, אור גרשון, כי מישהו הציג לו מחקר קליני שבדק טיפול הומיאופתי לאלרגיה, שהראה כי הטיפול ההומיאופתי יעיל, ותהה כיצד משיבים לטיעון כזה. חבר אחר בקבוצה התנדב לקרוא את המאמרים ולנתח את הכשלים שבהם.
עד כאן הכל טוב ויפה, אולם לאחר שקראתי את הניתוחים בפייסבוק נאלצתי להסתייג מהם. הבטחתי לקרוא את המאמרים, והתחייבתי להגיב גם למאמרים וגם להערות שבדיון במועד מאוחר יותר. אמנם עברו כבר כמה שבועות, ואני אמנם לא בן למשפחת לאניסטר, אבל אעמוד בהתחייבותי, לאחר שקראתי גם את המאמר עצמו, וגם את התגובות למאמר שפורסמו בכתב העת לאחר פרסומו.
אני רוצה להדגיש כי הביקורת שאכתוב מייד על הדברים שכתב הקורא אינה מיועדת להלבין את פניו ברבים, אלא מתוך רצון כן לסייע לו ולקוראים האחרים להבין טוב יותר את הניסוי, תכנונו, והניתוח הסטטיסטי.
כמו כן, אני מוצא את עצמי נאלץ להגן על ניסוי קליני הומיאופתי מפני טענות על כשלים כביכול שהוטחו בו, מכיוון שהטענות אינן נכונות. הניסוי המתואר במאמר הוא לדעתי ניסוי מתוכנן היטב, ומנטרל בצורה טובה מאוד הטיות אפשריות במחקר מסוג זה. למרות זאת, תקפות התוצאה שפורסמה בהבלטה במאמר, המראה יתרון טיפולי להומיאופתיה על פני פלסבו באחד המדדים, מוטלת בספק. רק אחד המבקרים של הניסוי הצליח להצביע על נקודת הכשל.
מדובר המאמר ישן למדי, שפורסם בשנת 2000 בכתב העת BMJ, שבהחלט אינו כתב עת זניח. המאמר (( 1. Taylor, M. A., Reilly, D., Llewellyn-Jones, R. H., McSharry, C., & Aitchison, T. C. (2000). Randomised controlled trial of homoeopathy versus placebo in perennial allergic rhinitis with overview of four trial series. BMJ: British Medical Journal,321(7259), 471.)) תיאר, כאמור, ניסוי קליני בו נבדק טיפול הומיאופתי ל- perennial allergic rhinitis (דלקת/נזלת בחלל האף הנגרמת עקב אלרגיה לא עונתית). הניסוי המתואר פשוט מאוד. המועמדים/מתנדבים להשתתפות בניסוי עברו תהליך סינון, בו נבדק האם מצבם הרפואי מתאים לטיפול, נעשתה הערכה של האלרגנים שגרמו למצבם, ולכולם ניתן טיפול ראשוני. לכל החולים בשלב זה ניתן פלסבו, אך נאמר להם כי הם קיבלו טיפול הומיאופתי מותאם למצבם. במשך שבועיים המועמדים היו מטופלים בפלסבו שחשבו כי הוא טיפול הומיאופתי, וניהלו רישום יומי של מצבם. לתקופת מעבר זו, בה החולים אינם מטופלים אך חושבים כי קיבלו טיפול הומיאופתי, יש שתי מטרות: איסוף נתוני בסיס, וניטרול אפקט פלסבו אפשרי. לאחר תקופת המעבר, חולקו החולים בהקצאה רנדומלית לשתי קבוצות. קבוצה אחת קיבלה טיפול הומיאופתי, השניה המשיכה לקבל פלסבו. החלוקה נעשתה בסמיות כפולה; לא החולים ולא הרופאים/חוקרים ידעו איזה סוג של טיפול קיבל כל חולה. החולים המשיכו לערוך רישום של מצבם במשך ארבעה שבועות נוספים. בסיום הניסוי, נערכה השוואה של השינוי הממוצע מהבסיס לסיום הטיפול בין שתי הקבוצות. החוקרים חישבו כי כדי לשמור על רמת מובהקות (הסתברות לתוצאה חיובית שלילית – false positive) של 5%, ובמקביל להשיג עוצמה (הסתברות לתוצאה חיובית כאשר יש אפקט טיפולי – true positive) של 80%, יש צורך במדגם בגודל 120 חולים (60 בכל קבוצה). בפועל הצליחו החוקרים לגייס לניסוי רק 51 חולים. עד כמה זה קריטי? אתייחס לכך בהמשך.
תוצאת הניסוי: נצפה הבדל מובהק סטטיסטית בין הקבוצות, המראה יתרון לטיפול ההומיאופתי במדד Nasal inspiratory peak flow, עם זאת, במדד Visual analogue scale (VAS), לא נצפה אפקט טיפולי. המדד הראשון, בו התקבלה תוצאה מובהקת סטטיסטית נחשב למדד אובייקטיבי, ואילו המדד השני נחשב לסובייקטיבי. החוקרים גם מציינים כי ההבדל המובהק במדד הראשון נחשב משמעותי מבחינה קלינית.
בהמשך סוקרים החוקרים תוצאות של שלושה ניסויים אחרים שקדמו לניסוי זה, ועורכים ניתוח מאוחד (pooled analysis) המסכם יחדיו את תוצאותיהם. ברשימה זו לא אתייחס לחלק זה של המאמר/
כצפוי, המחקר עורר סערה, ובמערכת כתב העת התקבלו מספר תגובות המבקרות את המחקר וממצאיו (( 2. Homoeopathy versus placebo in perennial allergic rhinitis. BMJ: British Medical Journal, 2001; 322(7279): 169. )). הנה סקירה של חלק מהתגובות (הקשורות לתחומים שאני מבין בהם משהו) והתייחסותי.
בארי מילר, רופא מרדים במקצועו, טוען כי הניתוח הסטטיסטי לקוי, מכיוון שגודל המדגם בפועל היה רק 51 חולים, ולא 120 כפי שתוכנן. לכן עוצמת הניסוי הייתה, לפי חישוביו, רק 43% ולא 80% (לא בדקתי את החישוב). אומר בעדינות כי הטענה הזו מראה חוסר הבנה בסטטיסטיקה ובמתודולוגיה של ניסויים קליניים. ניתן לטעון, אולי, כי אין זה אתי לבצע ניסוי קליני שעוצמתו נמוכה, אבל מה זה קשור לניתוח הסטטיסטי? החוקרים משיבים לו כראוי, ומסבירים כי הסיכון הנובע מעוצמה נמוכה הוא הסתברות גבוהה יותר להחמצה של תגלית – false negative. במלים אחרות, כאשר העוצמה נמוכה, ייתכן שהניסוי לא יצליח לגלות את קיומו של אפקט אמיתי, אם הוא קיים. רמת המובהקות של הניסוי, ההסתברות לתגלית שגויה – false positive, כלומר מצב בו נראה כאילו יש אפקט טיפולי כאשר בפועל אין אפקט כזה, אינה תלויה בגודל המדגם. החוקרים עוד מגדילים לעשות, ומשערים כי ייתכן והתוצאה השלילית שהתקבלה במדד הסובייקטיבי VAS נבעה מגודל המדגם הקטן והעוצמה הנמוכה. במובן הזה, הביקורת של ד"ר מילר הייתה סוג של גול עצמי.
בריאן ליפוורת', פרופסור לאלרגיה ורפואה נשימתית, מעיר בין היתר כי היה רצוי וראוי לבצע ניסוי המשווה את הטיפול ההומיאופתי לטיפול הרפואי המקובל (כגון סטרואידים או אנטיהיסטמינים), הידוע כיעיל לטווח ארוך. הצדק עימו.
ד"ר יורגן וינדלר, ראש המחלקה לרפואה מבוססת ראיות במכון המחקר MDS באסן, גרמניה, מעלה טענה חזקה: חישובי גודל המדגם נעשו על פי מדד VAS, ועל סמך התוצאות שהתקבלו בשלושת הניסויים הקודמים. במדד זה הניסוי נכשל. כלומר, הניסוי לא הצליח לשחזר את התוצאות של הניסויים הקודמים. לדעתי זהו הכשל העיקרי בניסוי זה. מכיוון שחישובי גודל המדגם נעשו על פי מדד זה, הרי שבפועל זהו משתנה המחקר הראשי (primary endpoint) של הניסוי, (( 3. לא ברור לי מהקריאה במאמר האם בפרוטוקול הניסוי הוגדר מראש משתנה מחקר ראשי, ואם כן, מהו.)) ועל פי הכללים המקובלים בניסויים קליניים, כשלון במשתנה המחקר הראשי הוא כשלון הניסוי כולו. התייחסות להצלחה במשתנה מחקר משני לאחר כשלון במשתנה המחקר הראשי משמעותה ניפוח ההסתברות לטעות מסוג ראשון – false positive – של המחקר, והיא גדולה מ-5%, בניגוד למה שהוצהר. (( 4. לו נתנו החוקרים את דעתם על כך מראש, היו יכולים להגדיר את שני המשתנים כראשיים, ולהגדיר תיקון סטטיסטי שהיה מאפשר תוצאה מובהקת למשתנה השני גם כאשר הראשון אינו מובהק. ברור שלא עשו כן, אחרת היו מציינים זאת במאמר.)) ד"ר וינדלר מתייחס בהמשך גם לניתוח המאוחד של תוצאות כל ארבעת הניסויים, ומעיר מספר הערות נכונות לגבי ניתוח זה.
שתי תגובות נוספות הן של ה. מורו בראון, מומחה לאלרגיה, התוהה האם החולים סבלו מלכתחילה מדלקת אלרגית לא עונתית), ומייקל דין, סטודנט לדוקטורט בבריאות הציבור מאוניברסיטת יורק, שטען כי פרסום מחקר ברמה גבוהה המראה תוצאות חיוביות בטיפול הומיאופתי רק מבליט את הסטנדרט הכפול בהתייחסות של הממסד הרפואי להומיאופתיה.
מכאן אעבור להערות של הקורא בקבוצת הפייסבוק. הוא התייחס בתחילה דווקא לתגובות הקוראים למחקר, ובטעות ייחס אותן לעורכי כתב העת. כך הוא כותב , למשל (תיקנתי כמה טעויות כתיב/הקלדה): "המאמר המצורף מתחיל בהערה מאת המפרסם: ‘Statistics in study were flawed’-סטטיסטיקות במחקר לוקות בחסר. מה זה אומר? זה אומר שהעורכים המקצועיים (שהם אנשי מקצוע לפני היותם עורכים מדעיים) עבור על הנתונים (שחייב כל מפרסם מאמר לספק יחד עם המאמר) ומצעו בו פגמים/כשלים בתחום הסטטיסטי."
ובכן, ההערה היא למעשה הכותרת שנתנו עורכי כתב העת לתגובתו של בארי מילר, וכבר הסברתי את הבעייתיות שבה. הקורא מצטט גם חלק מתגובתו של ד"ר וינדלר, ומייחס אותה לעורכי כתב העת, ולאחר מכן שוב חוזר לטענה לפיה המחקר פגום בגלל גודל המדגם הנמוך מהמתוכנן, וכותב: "החוקרים בסופו של דבר גייסו רק 51 נבדקים, אבל ניתחו את הנתונים כאילו היו להם כל ה120!". זה חוסר הבנה של הניתוח שבוצע במחקר. החוקרים ניתחו נתונים של 51 חולים, כי אלה הנתונים שהצליחו לאסוף. מספר החולים בכל קבוצה אכן נלקח בחשבון בעת ביצוע המבחן הסטטיסטי (מבחן t בניסוי הספציפי הזה). האם הקורא טוען כי החוקרים הציבו בנוסחאות גדלי קבוצות השווים ל-60, במקום 24 ו-27 כפי שהיה בפועל? זוהי האשמה חמורה ביותר, כיוון שמעשה כזה הוא רמאות לכל דבר. אני מתקשה להאמין שזה מה שקרה. כפי שהסברתי, גודל המדגם הנמוך פוגע אמנם בעוצמה הסטטיסטית של הניסוי, אך לא בתקפות הסטטיסטית שלו.
בהערה הבאה שלו בדיון, מתייחס הקורא למאמר המתאר את המחקר עצמו (וזה אינו המאמר "בצורה לא ערוכה" כפי שחשב בטעות). תחילה טוען הקורא כי "51 חולים אינה נחשבת קבוצת מדגם רחבה דיה". מדוע? האם זה נכון תמיד? לא ולא! גודל המדגם נקבע על פי שלושה גורמים: ההתפלגות הצפויה של הנתונים שייאספו בניסוי, גודל האפקט הטיפולי שמבקשים החוקרים לזהות, והעוצמה הסטטיסטית שהם מבקשים לעצמם (וזאת בהנחה שרמת המובהקות חייבת להיות 5%, הסטנדרט המקובל במחקר). לכל מחקר גודל המדגם המתאים לו. אפשר בקלות לבנות דוגמה בה גודל מדגם של 50, 40 או אפילו פחות מכך יהיה מספיק בהחלט.
הקורא טוען גם כי העובדה ש המשתתפים בניסוי הכירו את עקרונות ההומיאופתיה יצרה הטיה מחשבתית כלפי התרופה הנבדקת. אז מה? והאם בניסוי "רגיל", בו בודקים למשל את ההשפעה הטיפולית של אנטיביוטיקה לעומת פלסבו אין "הטיה מחשבתית"? בדיוק לשם כך עורכים ניסוי כפול סמיות. החולים לא ידעו אם טופלו בפלסבו או בתכשיר הומיאופתי, וגם החוקרים לא ידעו זאת. זהו סטנדרט הזהב לניסוי קליני. במאמר מסבירים החוקרים בפירוט את הנוהלים בעזרתם נשמרה הסמיות הכפולה.
הקורא ממשיך וטוען כי בגלל שבזמן הניסוי (אם כי לא בתקופת הסינון) הותר לחולים לקחת תרופות נוספות, אזי כל טענה שעולה מהמחקר מופרכת לחלוטין. זה בפירוש לא נכון, מכיוון שהחולים בשתי קבוצות הטיפול השתמשו בתרופות נוספות, וההשפעות אמורות להתאזן. אני מסכים שייתכן והיה מקום להגביל את השימוש בתרופות מסויימות, ו/או לתקנן את הניתוח הסטטיסטי על ידי הוספת משתנה מסביר לניתוח, אבל לא חושב שזו נקודה קריטית. הטענה של הקורא כי המחקר חייב להתבצע ב-"ואקום כימי" בו אסור למשתתפים ליטול אף תרופה אחרת היא בפירוש לא נכונה, ודרישה גורפת כזו אינה אתית.
הקורא גם טוען כי החלוקה הלא שווה בין הקבוצות: 27 בקבוצת פלסבו לעומת 24 בקבוצת הטיפול, מעלה תהיות לגבי מהימנות שיטת החלוקה (רנדומיזציה). ובכן, אי אפשר לחלק 51 חולים לשתי קבוצות שוות. הטוב ביותר שאפשר הוא חלוקה של 26-25. נכון, כאן החלוקה קצת פחות טובה: 24-27. אם תקחו מטבע ותטילו 51 פעמים, מה ההסתברות כי תקבלו בדיוק 26 הטלות של עץ ו-25 הטלות של פלי? (( 5. רק 11%, כלומר יש הסתברות של 89% כי התוצאה לא תהיה 25-26.)) אם תקבלו 27 עץ ו-24 פלי, האם תחשדו כי המטבע אינו הוגן? (( 6. לא. אם תבדקו את ההשערה כי ההסתברות של המטבע ליפול על עץ היא 0.5 תקבלו ערך-p של 0.6683. ))
הקורא חוזר לפרוצדורות של הניסוי: במאמר הוסבר כי הותאם תכשיר הומאופתי לכל משתמש בנפרד, על בסיס האלרגן שאליו הייתה לו התגובה הכי חמורה במבחן עור, ושבמקרה של אי ודאות נעשתה התייעצות עם רופא מנוסה בהומיאופתיה. מכאן מסיק הקורא, לא ברור לי על סמך מה, כי "המחקר כולו מבולגן ע"פ אנשים שונים עם אלרגיות שונות לאלרגנים שונים. כל אחד מהם מקבל תכשיר הומיאופתי שונה". אחת הטענות עיקריות של הומיאופתים בבואם להסביר מדוע לא ניתן לבחון טיפול הומיאופתי בניסויים קליניים, היא בדיוק הטענה הזו – לכל חולה יש צורך להתאים טיפול ייחודי. זהו עקרון בסיסי בהומיאופתיה. החוקרים עקפו את הבעיה הזו בצורה נהדרת: לכל חולה הותאם התכשיר ההומיאופתי המתאים לו, לדעת הרופא/הומיאופת המטפל. לאחר מכן הלך החולה לבית המרקחת, וקיבל שם או את התכשיר הומיאפתי שהותאם לו, או פלסבו, לפי תכנית הרנדומיזציה! החולה לא ידע אם קיבל תכשיר הומיאופתי או פלסבו, וגם לא הרופא המטפל. כך נשמרה הסמיות הכפולה. התהליך הוסבר במפורט במאמר, ולדעתי אין בכך כל פגם, אם כללי הפרוטוקול נשמרו.
הקורא ממשיך וכותב: "כמו גם מצוין כי ‘although the researchers were not blinded.’ – החוקרים לא היו 'בעיוורון', כלומר המחקר אינו באמת בסמיות כפולה.". זו הערה גרועה במיוחד מצידו של הקורא, המראה כי לקה בקריאה סלקטיבית והוציא דברים מהקשרם. החוקרים ידעו כי נתנו לחולים פלסבו ובכל זאת אמרו לחולים כי קיבלו תכשיר הומיאופתי בתחילת תהליך הסינון, אשר התרחש שבועיים לפני הרנדומיזציה עצמה. כפי שהסברתי קודם, המטרה הייתה לגרום לחולים לחשוב כי הם מקבלים טיפול הומיאופתי כדי לנטרל את אפקט הפלסבו, ובאותו זמן להחזיק אותם שבועיים ללא טיפול הומיאופתי, כדי לייצר נתוני בסיס נקיים מהשפעה אפשרית של הטיפול. תכנון מבריק.
לסיכום: רוב ה"כשלים" בניסוי עליהם הצביעו מבקריו אינם כשלים כלל וכלל. הבעיה העיקרית בניסוי היא הבעיה עליה הצביע ד"ר וינדלר: מתיאור הניסוי עולה כי הוא תוכנן כדי לזהות אפקט במדד מסויים – VAS, ונכשל לזהות את האפקט במדד הזה, ש/הוא משתנה המחקר הראשי (בפועל). אמנם נצפה אפקט במשתנה אחר, אבל מדובר במשתנה מחקר משני, והסיכוי לתוצאת false positive במשתנה המשני גבוהה יותר מ-5% אם לא נצפה אפקט במשתנה הראשי.
נשלח: 20 באפריל, 2014. נושאים: ביוסטטיסטיקה, מדע, ספקנות.
תגובות: 13
| טראקבק
בריאות – זה אצלי בגנים: המסע לגילוי רפואה מותאמת אישית
גם השנה נתתי הרצאה במסגרת פסטיבל אייקון.
![]() |
מאחר ונושא הפסטיבל השנה היה "זהות", בחרתי להרצות על הדרך בה ניתן לרתום את היכולת למיפוי הגנום האנושי, הקובע את הזהות היסודית של כל אחד מאיתנו, לצורך פיתוח רפואה מותאמת אישית – כל חולה יוכל לקבל תרופה ייחודית המתאימה לו בדיוק. כל זאת, מנקודת המבט של סטטיסטיקאי העוסק בפיתוח קליני של תרופות.
נשלח: 25 בספטמבר, 2013. נושאים: ביוסטטיסטיקה, בריאות, מדע.
תגובות: 6
| טראקבק
ההיסטוריה של הניסויים הקליניים – עכשיו הסרט
ביולי האחרון הרציתי במסגרת ערב "ספקנים בפאב" שנערך בבאר שבע על ההיסטוריה של הניסויים הקליניים (הרצאה שכבר ננתי כמה פעמים בעבר תחת הכותרת "מהלימון ועד הקופקסון"). ההרצאה בבאר-שבע צולמה, והועלתה לאחרונה לערוץ היוטיוב של קהילת הספקנים הישראלית, שם תוכלו לצפות בהרצאות מרתקות נוספות. כאן תוכלו כמובן לצפות בהרצאה שלי. צפיה מהנה!
נשלח: 15 בנובמבר, 2011. נושאים: ביוסטטיסטיקה, האנשים שמאחורי הסטטיסטיקה, היסטוריה.
תגובות: 2
| טראקבק
הודעה: הרצאה בפטיבל אייקון
אייקון TLV, הפסטיבל הבינלאומי למדע בדיוני ופנטזיה, נערך מדי שנה בתל אביב בחול המועד סוכות.
במסגרת הפסטיבל שייערך השנה, אתן הרצאה על ההיסטוריה של הניסויים הקליניים, נושא שהיה בבחינת מדע בדיוני בהיסטוריה הלא ממש רחוקה שלנו. ההרצאה תתבסס על הרצאה "מהלימון ועד הקופקסון" שנתתי לפני כחצי שנה, אולם ההדגשים יהיו שונים, בהתאם לקהל היעד.
פרטים על מועד ההרצאה יפורסמו בקרוב באתר הפסטיבל וגם כאן.
נשלח: 17 באוגוסט, 2010. נושאים: כללי.
תגובות: אין
| טראקבק
מהלימון ועד הקופקסון – מצגת
היום נתתי במועדון קשישים בתל-אביב הרצאה שנשאה את הכותרת: "מהלימון ועד הקופקסון – קיצור תולדות הנסויים הקליניים", לחיצה על הקישור תפתח קובץ pdf של מצגת ההרצאה. אני מקווה לכתוב אחלק מהדברים בצורת רשימה מסודרת כאן בבלוג בעתיד הקרוב. חלק מהדברים כבר מוכרים לכם, ומבוססים על הרשימה "הסטטיסטיקה שהצילה חיים – סיפורה של פלורנס נייטינגייל" שהתפרסמה כאן בעבר.
נשלח: 18 במרץ, 2010. נושאים: ביוסטטיסטיקה, האנשים שמאחורי הסטטיסטיקה, היסטוריה.
תגובות: 1
| טראקבק
Facts about poop
אל הדף "Facts about poop" הגעתי דרך הרסס שעוקב אחרי הדפים המתוייגים בדלישס בתגיות סטטיסטיקה והומור. הנה חלק המידע המעניין נמצא בדף.

בסוף המאה הקודמת עבדתי בשירות חברה שמייצרת, בין היתר, תחליפי חלב אם לתינוקות. החברה ערכה ניסוי קליני בו השתתפו קרוב לעשרת אלפים תינוקות, חלקם הוזנו בתחליף החלב שייצרה החברה הזו וחלקם במוצרים של המתחרים (כאשר בין המתחרים נכללו גם חלב אם, כלומר הנקה, חלב פרה, ותחליפים אחרים).
מטרת הניסוי הייתה לבדוק האם יש הבדלים בין המזונות השונים בכל הקשור לתוצרי מערכת העיכול. הורי התינוקות ניהלו יומנים, ותיעדו (בקפידה, אני מקווה) את היציאות של ילדיהם: כמה, מתי, וגם את התכונות הספציפיות של כל תוצר: צבע, מרקם, ריח ועוד. תפקידי היה כמובן לנתח את הנתונים שנאספו.
סיפרתי לבני הבכור, שהיה אז בן 5 בערך, על הניסוי הזה. הוא הקשיב בעניין, ולבסוף שאל: "וכל התינוקות האלה, כשהם בוכים, הם לא מפריעים לך בעבודה?"
נשלח: 15 בפברואר, 2010. נושאים: אותי זה מצחיק, בנימה אישית.
תגובות: אין
| טראקבק
מהו p-value?
מדענים אובססיביים כלפיו. עורכי כתבי עת לא יפרסמו מאמרים אם הוא לא יופיע בהם. החלטות של מאות מיליוני דולרים מתקבלות על פיו. ובכל זאת, רק מתי מעט מבינים אותו. זהו ה-"p-value". אותו מספר קסם חורץ גורלות המתלווה כמעט לכל ניתוח סטטיסטי.
הזכרתי אותו ברשימה שכתבתי על הניסוי הקליני לחיסון נגד נגיף ה-HIV. ה-p-value, איך לא, היה הנתון העיקרי שפורסם בהודעה הראשונה על תוצאות אותו ניסוי. הוא הגיע עד לוול-סטריט גו'רנל. הוול סטריט ג'ורנל ציין, בכתבה על אותו הניסוי. כי ה-p-value הוא "ההסתברות כי התוצאה התקבלה במקרה" ("Probability that the result is due to chance ") . זה לא נכון. בהמשך אסביר כיצד לחשב את ההסתברות הזו, אבל לפני כן אנסה להסביר מהו באמת אותו p-value, ומהי משמעותו.
אתחיל בקצת רקע, לטובת מי שלא קרא את הרשימה "בין שתי טעויות" (או מי שלא זוכר מה כתוב שם). בבסיסה של כל בעיית החלטה סטטיסטית עומדות שתי השערות (hypotheses). ההשערה הבסיסית, המכונה גם "השערת האפס" מבטאת את האמונה (המדעית) המקובלת. בימי גלילאו, השערת אפס טיפוסית יכולה להיות "השמש מסתובבת סביב הארץ". בניסוי הקליני לחיסון נגד נגיף ה-HIV השערת האפס היא "החיסון הנסיוני לא מפחית את הסיכוי להדבק בנגיף". ואם נעבור לאנלוגיה של עולם המשפט, הרי שבמדינות מתוקנות מניחים כי אדם המואשם בפשע ועומד לדין הינו זכאי עד שתוכח אשמתו, כלומר השערת האפס של השופט אומרת כי "הנאשם זכאי".
מול השערת האפס ניצבת תמיד ההשערה האלטרנטיבית. בהקשר המדעי, השערה זו מבטאת תיאוריה חדשה שמועמדת לדחוק את התיאוריה הישנה. גלילאו הציע את ההשערה האלטרנטיבית "הארץ מסתובבת סביב השמש". עורכי הניסוי הקליני הנ"ל הציגו את ההשערה האלטרנטיבית כי "החיסון הנסיוני מפחית את הסיכוי להדבק בנגיף", והתובע מציג בפני השופט את ההשערה האלטרנטיבית כי "הנאשם אשם".
אלא אם אתה הומיאופת, עליך להציג טיעונים משכנעים בעד ההשערה האלטרנטיבית שלך. (גם הומיאופתים צריכים לעשות זאת, למעשה, אבל אף אחד כבר לא מצפה מהם). כדי להביא להרשעת הנאשם, התובע צריך להציג בפני השופט עדויות שישכנעו אותו, מעבר לספק סביר, כי הנאשם אכן ביצע את הפשע המיוחס לו. מה זה "מעבר לספק סביר"? כל אחד קובע את הרף שלו לעצמו, ואגיד על כך כמה מלים בהמשך. אם אדם מואשם בשוד תחנת דלק, למשל, יכול השופט להחליט כי ירשיע את הנאשם אם יופיעו בפניו שני עדי ראיה שיעידו כי הנאשם הוא אכן השודד. שופט מחמיר יותר אולי ידרוש שלושה עדים, וגם הוכחה כי הכסף נמצא בידי הנאשם, ושופט אחר אולי יסתפק בוידאו של מצלמת האבטחה. זה לא ממש משנה. העיקר הוא שיש השערות, עדויות, וכלל החלטה קבוע מראש.
כדי להביא את הדיון לפסים מדויקים יותר, אשתמש בדוגמא מלאכותית. כוכב הדוגמא שלנו הוא חקלאי שמגדל למחייתו עדר פרות חולבות. הפרות נכנסות מדי פעם להריון (אחסוך מכם את הפרטים). חלקן ממליטות עגלים וחלקן עגלות. החקלאי שלנו מעדיף כמובן כי פרותיו ימליטו עגלות נקבות, שיצטרפו בבוא הימים למערך ייצור החלב, והן לכן רווחיות יותר מעגלים זכרים. אולם מי ששולטת בהתפלגות המינים בהמלטות היא אמא טבע, הדואגת לכך שההסתברות להמלטת נקבה בכל הריון היא 0.5.
והנה, כיום בהיר אחד מגיע לחווה סוכן נוסע, המציע לחקלאי שלנו לרכוש שיקוי פלא, שיעלה את ההסתברות להמלטת נקבה מ-0.5 ל-0.9 אצל כל פרה שתלגום ממנו. כדי לשכנע את הרפתן הספקן, מציע הסוכן הצעה שאין לסרב לה: "קח נא בקבוק אחד, והשקה בו 20 פרות. לאחר מכן המתן וראה כמה המלטות נקבה יהיו בקרב 20 פרות אלה. אם לא תהיה מרוצה. כספך יוחזר לך". הדוד משה מסכים לבצע את הניסוי. יש לו השערת אפס: "ההסתברות להמלטת נקבה היא 0.5" והשערה אלטרנטיבית: "ההסתברות להמלטת נקבה היא 0.9". כיוון שהוא זוכר היטב את שיעורי המבוא לסטטיסטיקה שלמד בפקולטה לחקלאות (היי, אמרתי שזאת דוגמא מלאכותית!), הוא יודע לבנות כלל החלטה על פי הלמה של ניימן ופירסון, ומחליט לדחות את השערת האפס לטובת ההשערה האלטרנטיבית אם ב-20 ההמלטות יהיו 15 המלטות נקבה או יותר.
במלים אחרות, החקלאי החליט כי העדות הדרושה לדחיית השערת האפס לטובת האלטרנטיבה היא המלטת של 15 (או יותר) נקבות. אם יהיו 15 המלטות נקבה הוא ישתכנע ביעילותו של שיקוי הפלא. אם יהיו 16, או 17 או אף יותר, הוא בודאי ישתכנע.
החקלאי יכול לנסח את כלל ההחלטה שלו בצורה אחרת, אך שקולה. בהנתן עדות כלשהי (עדות כאן היא מספר המלטות הנקבה) הוא ישאל את עצמו: בהנחה שהשיקוי הוא תרמית, מה ההסתברות כי הייתה מתקבלת עדות זו שוב, או אף עדות משכנעת יותר? למשל, אם אכן צפה בהמלטת 15 נקבות מתוך 20, זו אולי עדות משכנעת, אך תוצאה של 16, 17, או יותר, היא עדות משכנעת יותר. אם השיקוי הוא תרמית, וההסתברות להמלטת נקבה נותרה 0.5, אז אפשר לחשב כי ההסתברות להמלטת 15 נקבות או יותר היא 0.0207. זוהי הסתברות קטנה למדי. אם ההסתברות לקבל תוצאה יותר משכנעת ממה שקיבלנו היא קטנה, הרי שהתוצאה שלנו היא משכנעת דיה.
ההסתברות לקבלת עדות דומה או חזקה יותר מהעדות שנצפתה, בהנחה שהשערת האפס נכונה, היא ה-p-value המפורסם.
ה-p-value, לעומת זאת, אינו ההסתברות כי התוצאה התקבלה במקרה, כאשר אני מניח כי הכוונה המבוטאת במילה "במקרה" היא "בהנחה שהשערת האפס נכונה". קל לראות מדוע זה כך. בדוגמא המלאכותית שלנו, ה-p-value הוא ההסתברות כי היו 15 או יותר המלטות נקבה מתוך 20. ההסתברות שהתוצאה של 15 המלטות נקבה תתקבל, אם ההסתברות להמלטת נקבה היא 0.5, היא לעומת זאת 0.0148.
ומה ההסתברות כי התוצאה שהתקבלה בניסוי הקליני לחיסון נגד איידס "is due to chance"?. כזכור השתתפו בניסוי הנ"ל 16395 מתנדבים, מתוכם ל-125 זוהו כנשאי נגיף HIV: 51 מבין 8197 נבדקים שקיבלו את החיסון הנסיוני, ו-74 מבין 8198 המתנדבים שקיבלו חיסון דמה. תארו לכם כד ובתוכו 16395 כדורים, מתוכם 8197 כדורים ירוקים, והשאר אדומים. אם תשלפו מהכד 125 כדורים, מה ההסתברות כי בדיוק 51 מתוכם יהיו ירוקים? זוהי בדיוק ההסתברות כי תוצאות הניסוי הנ"ל התקבלה במקרה, כלומר: אין לחיסון שנבדק אפקט חיסוני אמיתי. החישוב דומה לחישוב הסתברויות הזכיה בלוטו. זהו מודל הסתברותי היפר-גאומטרי. החשבון פשוט, ובזכות המחשבון הזה גם החישוב לא מסובך. ההסתברות היא 0.0085, שונה מה-p-value שפורסם, 0.039.
נשלח: 12 בנובמבר, 2009. נושאים: ביוסטטיסטיקה, מה אומרת הסטטיסטיקה.
תגובות: 32
| טראקבק
חיסון נגד איידס באופק?
לא ברור.
מתברר שבתאילנד נערך לאחרונה ניסוי קליני שנועד לבדוק את יעילותו של חיסון אפשרי נגד איידס. לי נודע כל הסיפור מהניוזלטר המצויין "Chance News" (זה כבר בכלל אתר ויקי), שהביא שני אייטמים בנושא בגליון האחרון שלו (הנה הראשון והנה השני). צ'אנס ניוז דיווח על ידיעה בוול סטריט ג'ורנל, וידיעה בסיינס מגזין. כמו כן מצאתי ראיון עם פרופ' ויקטור דה-גרוטולה, יו"ר המחלקה לביוסטטיסטיקה בביה"ס לבריאות הציבור באוניברסיטת הארוורד. הראיון נערך בעקבות הפרסום על תוצאות הניסוי הנ"ל, ועסק בעיקר במושג ה-p-value ומשמעותו – נושא שאדון בו ברשימה אחרת בעתיד. ברשימה הזו אתרכז בניסוי הקליני ומשמעות התוצאות.
נתחיל בתיאור הניסוי. תכנון הניסוי הוא קלאסי: המשתתפים בניסוי מחולקים באופן אקראי לשתי קבוצות. קבוצה אחת מקבלת את החיסון הנסיוני. לחברי הקבוצה השניה מוזרק חיסון דמה – מי מלח. כעבור 3 שנים, בודקים לכמה מהמשתתפים בכל קבוצה יש תוצאה חיובית בבדיקת HIV. מדובר בניסוי גדול למדי (לפחות במושגים שלי) – סה"כ השתתפו בו כ-16,000 איש, כולם בתאילנד. עם זאת, איני יודע מה גודל המדגם הדרוש לניסוי כזה, כיוון שאיני יודע מהו שיעור ההדבקות באיידס בתאילנד. עם זאת אציין כי בניסוי הקליני שבדק את החיסון של סאלק נגד מחלת הפוליו, שנערך בארה"ב ב-1954, היו כ-400,000 משתתפים (את הפרט הזה מצאתי בעותק הישן שלי של ספרו של להמן, אני מניח שניתן למצוא אותם אי-שם ברשת).
והנה התוצאות שפורסמו: מבין 8197 מתנדבים שקיבלו את החיסון הנסיוני, 51 בכל זאת הראו תוצאה חיובית בבדיקת HIV, כלומר כ-0.6%. לעומת זאת, מבין 8198 מתנדבים שקיבלו את חיסון הדמה, 74 הראו תוצאה חיובית בבדיקת HIV, כ-0.9%. מכאן, שהחיסון הנסיוני הקטין את שיעור ההדבקות בכשליש. האם זו תוצאה משמעותית מבחינה קלינית? האם ייתכן כי רק במקרה התקבלה תוצאה כזו, ואין קשר בין הטיפול שקיבלו החולים (חיסון נסיוני או פלסבו) לבין ההדבקות או אי-הדבקות באיידס?
לשם כך נערך מבחן סטטיסטי, ובסיינס מגזין (וגם בוול סטריט ג'ורנל) פורסמה השורה התחתונה שלו: p=0.039. ה-p (הידוע גם בשם p-value) הוא ההסתברות כי בניסוי דומה יתקבלו תוצאות "משכנעות" יותר אם החיסון לא יעיל במניעת ההדבקות*. מכיוון שמקובל לראות בערכי p הנמוכים מ-0.05 ערכים מובהקים סטטיסטית, הרי שהשורה התחתונה אומרת כי התוצאה שהתקבלה מובהקת סטטיסטית, והניסוי מספק עדות ליעילותו של החיסון הנסיוני. הסטטיסטיקאי פול אלפר, שכתב את הידיעה בצ'אנס ניוז, חישב אמנם כי ערך ה-p, על פי מבחן פישר, הוא דווקא 0.048 (לפי החישוב שלי, הערך 0.039 התקבל ממבחן חי-בריבוע, וערכתי את דף הויקי בצ'אנס ניוז בהתאם – אני אחראי לפלט תכנת SAS המופיע שם, ועוד), אבל גם ערך זה נמוך ממספר הקסם 0.05, כלומר גם לפי אלפר התוצאות מובהקות סטטיסטית.
הבעיה היא שאי אפשר לרוץ ל-FDA רק עם p-value. יש צורך בניתוחים נוספים.
הנתונים שהובאו עד כה מכונים בז'ארגון המקצועי "נתוני ITT". ITT פירושו "Intent To Treat". נתונים אלה כוללים את התוצאות של כל המתנדבים שנכללו בניסוי, כולל אלה שלא עמדו בכל התנאים של הניסוי (למשל, לא קיבלו את כל הזריקות שהיו אמורים לקבל, לא הופיעו לחלק מבדיקות המעקב, נטלו תרופות אסורות במהלך הניסוי, וכדומה). אם "זורקים" את הנתונים של המתנדבים האלה מהאנליזה, נשארים רק המתונים של החולים שעמדו בכל התנאים של פרוטוקול הניסוי – "נתוני PP" (כאשר PP פירושו Per Protocol). בעוד שבנתוני ה-ITT היו בסך הכל 125 זיהומי HIV (51+74), הרי שבקרב המתנדבים שעמדו בתנאי הפרוטוקול (כלומר בנתוני ה-PP) היו 86 זיהומים בלבד. בשאלות לדיון פול אלפר טען (בשאלה לדיון מספר 1) כי ניתן לבצע חישוב לאחור (reverse engineering) ולמצוא כי בקבוצת הניסוי היו 36 זיהומים ובקבוצת הפלסבו היו 50 זיהומים, אך הוא הניח (מבלי לציין במפורש, אני ערכתי את השאלה לדיון) כי בשתי קבוצות הטיפול היה אותו מספר של חולים גם בנתוני ה-PP. אולם, במקרה כזה ה- p-valueשמתקבל הוא 0.13 ולא 0.16. לכן, המסקנה היא כי באוכלוסיית ה-PP לא היו גדלי הקבוצות שווים.
העובדה כי תוצאות ה-PP אינן מובהקות סטטיסטית לא צריכה להטריד. התוצאות הקובעות הן תוצאות ה-ITT, ותוצאות ה-PP רק צריכות להראות אפקט דומה לזה שנצפה בנתוני ה-ITT. השאלה המעניינת היא האם אפקט של 26% הוא מספיק "דומה" לאפקט של 31.2%. (למה תוצאות ה-ITT הן הקובעות ולא תוצאות ה-PP? שאלה מצוינת. התשובה אולי תבוא ברשימה אחרת אי שם בעתיד).
מה כן צריך להטריד בתוצאות הניסוי הזה? הפרטים שלא פורסמו, מן הסתם. למשל: אנו יודעים כי המתנדבים שלא עמדו בתנאי פרוטוקול הניסוי לא התחלקו שווה בשווה בין הקבוצות. כמה מתנדבים בכלל לא עמדו בתנאי הפרוטוקול? מדוע? מה הייתה החלוקה בין הקבוצות? מה גרם לחלוקה הלא שווה? האם היו תופעות לוואי משמעותיות בקרב המתנדבים שקיבלו את החיסון הנסיוני? האם שיעור תופעות הלוואי בקבוצת הניסוי גבוה משמעותית משיעורן בקבוצת הפלסבו? ניתוח של תופעות הלוואי יאפשר לקבוע האם התועלת שבחיסון הנסיוני עולה על הנזק האפשרי שהוא עלול לגרום.
וכמובן, השאלה שיש לשאול בכל מחקר מדעי: האם תוצאת הניסוי הזה ניתנת לשחזור? כדי לענות על כך, יש צורך לערוך ניסוי קליני נוסף. זוהי דרישה בסיסית של ה-FDA מכל חברת תרופות המבקשת לאשר טיפול רפואי חדש.
אני לא יודע את התשובות לכל השאלות האלה. לכן, אני לא יכול לקבוע האם התוצאות שפורסמו נותנות תקווה כי בעתיד הקרוב יהיה חיסון נגד נגיף ה-HIV. כתבתי את הרשימה הזו בחשש מה. ייתכן מאוד שמתנגדי החיסונים למיניהם ינסו לאמץ את הדברים שכתבתי כ"הוכחה" לאי-יעילות החיסונים, אינטרסים של חברות התרופות וכל הבלה בלה הרגיל. כדי להסיר ספק, אני מדגיש כאן כי זו לא כוונתי. לשאלות שנשארו פתוחות בעקבות הקריאה של הידיעה הראשונית אודות תוצאות הניסוי הזה יש תשובות, ואני בטוח כי אם התוצאות יוגשו ל-FDA כדי לרשום את החיסון, הן יישאלו וייענו (ה-FDA ישאל את עורכי הניסוי עוד הרבה שאלות קשות אחרות, תאמינו לי).
* הוול סטריט ג'ורנל ציין כי ה-p-value הוא "ההסתברות כי התוצאה התקבלה במקרה" ("Probability that the result is due to chance "). זה לא נכון. אני מתכוון להסביר את הנושא ברשימה בעתיד הקרוב.
נשלח: 7 בנובמבר, 2009. נושאים: ביוסטטיסטיקה, בריאות, מדע.
תגובות: 9
| טראקבק
כשלים סטטיסטיים אפשריים בניסויים קליניים – סקירת ספרות
כפי שכתבתי בהקדמה לסדרת הרשימות הזו, הופתעתי לגלות כי יש מעט מאוד פרסומים בנושא זה. ברשימה זו אסקור את המעט שמצאתי. אם מי מהקוראים מכיר או נתקל בעוד פרסומים בנושא, אשמח לקבל הפניה.
המשך הרשימה עלול להיות סתום בעיני חלק מהקוראים. לא להבהל – אני אסביר את הכל ברשימות הבאות בסדרה.
בשנת 2000 פרסמו Assmann, Pocock, Enos ו- Kasten מאמר שכותרתו "Subgroup analysis and other (mis)uses of baseline data in clinical trials" בכתב העת היוקרתי The Lancet. הם בחנו 50 מאמרים שמציגים תוצאות מניסויים קליניים, ופורסמו בארבעה כתבי עת מובילים בתקופה של שלושה חודשים בשנת 1997., ובחנו את האופן בו הוצגו ונותחו נתוני הבסיס (baseline data) של הניסויים האלה., וכן את הדרך בו השתמשו בנתונים אלה לפילוח אוכלוסיית הניסוי (subgrouping). המסקנות של קסטן ועמיתיה עגומות: מחצית המחקרים השתמשו בשיטות סטטיסטיות"לא מתאימות"; שני שליש מהמחקרים דיווחו תוצאות לגבי תתי-אוכלוסיות, שוב ללא שימוש במבחנים סטטיסטיים מתאימים. הארבעה פרסמו גם סקירה טכנית יותר של ממצאיהם המיועדת לסטטיסטיקאים בכתב העת Statistics in Medicine בשנת 2002.
Zlowodzki, Jönsson, ו- Bhandariפרסמו ב-2005 מאמר שכותרתו "Common Pitfalls in the Conduct of Clinical Research". הם מתייחסים שם למחלקה רחבה של מחקריים קליניים, ובפרט לניסויים קליניים מבוקרים. הכשלים האפשריים שהם מונים בניסוי קליני מבוקר הם: חוסר סמיות (lack of blinding), כשלים ברנדומיזציה, השמטת חולים שלא סיימו את הניסוי (dropouts) מניתוח הנתונים, עצמה סטטיסטית נמוכה עקב מדגם קטן מדי, והגדלת הטעות מהסוג הראשון עקב בדיקת השערות מרובות וניתוח משתנים מרובים.
Helberg פרסם ברשת מאמר שכותרתו "Pitfalls of Data Analysis", עם כותרת המשנה "How to Avoid Lies and Damned Lies". הלברג לא עוסק בניסויים קליניים אלא מתייחס לנושא באופן כללי. המאמר שלו מזכיר בסגנונו את הספר הקלאסי של דארל האף "How to lie with statistics", שגם נכלל ברשימת המקורות שלו. בין הכשלים שהוא מונה: הטיה עקב דגימה לא נכונה, חוסר תקפות של הנחות המודל הסטטיסטי, עצמה נמוכה, בדיקת השערות מרובות, טעויות מדידה. הוא מקדיש חלק שלם במאמר לכשלים בפירוש התוצאות של המחקר, ובפרט: ההבדל בין משמעות סטטיסטית למשמעות מעשית, אי התייחסות לדיוק התוצאות (הן במובן של precision והן במובן של accuracy), והפרשנות של מתאם כסיבתיות. בנוסף, הוא מביא דוגמאות להצגות גרפיות מטעות.
Strasak, Zaman, Pfeiffer, Gobel ו- Ulmerפרסמו ב-2007 מאמר שכותרת ו"Statistical errors in medical research – a review of common pitfalls" (הקישור לקובץ pdf). בעבודתם הם סקרו עשרות מאמרים שפורסמו בכתבי עת שונים, וזיהו בסך הכל 47 סוגי כשלים שונים. הם מיינו את הכשלים לחמש קבוצות לפי שלבי המחקר הרפואי: תכנון המחקר, ניתוח הנתונים, תיעוד המחקר, הצגת הנתונים, ופירוש התוצאות (interpretation). החלוקה הראשונית שלהם משמשת כבסיס לסדרת הרשימות הזו.
Young התייחס ב-2007 לעבודה של Strasak ועמיתיו במאמר שכותרתו "Statistical errors in medical research – a chronic disease?" (קישור לקובץ pdf), והוסיף תובנות משלו, בעיקר לגבי שלב ניתוח הנתונים. הוא אמנם משבח את עבודתם, אך מסתייג מקביעתם כי "אין צורך לקרוא ספרי לימוד שלמים בנושא הסטטיסטיקה". הוא מציין, ובצדק, כי "קריאה של טקסטים בסטטיסטיקה בהחלט שווה את המאמץ", וישנם ספרי לימוד שאינם כה קשים לקריאה.
הנושא של משמעות סטטיסטית מול משמעות קלינית הוא נושא כאוב למדי. לעיתים ניתן לגלות במחקר אפקט כלשהו מובהק סטטיסטית, אך האם יש לו גם משמעות מבחינה קלינית/רפואית? לא תמיד. בפגישת עבודה שהייתה לי ולעמיתיי לפני מספר חודשים עם פרופ טום פלמינג, מבכירי הסטטיסטיקאים של דורנו, הוא אמר (ציטוט חופשי מהזכרון): "מטרת הניסוי הקליני אינו השגת אפקט מובהק סטטיסטית, אלא השגת עדות סטטיסטית לאפקט משמעותי מבחינה קלינית". הדברים האלה ברורים לכל ביוסטטיסטיקאי, אך לא תמיד לחוקרים. לשמחתי, גיליתי מספר לא מועט של התייחסויות לנושא. פירוש מיידי של אפקט מובהק סטטיסטית כאפקט משמעותי מבחינה קלינית הוא לא רק כשל באינטרפרטציה. זה מעיד גם על כשל בשלב התכנון של הניסוי, וגם על כשל בניתוח של כלל הנתונים שהצטברו. שני דיונים טובים בנושא ניתן למצוא במצגת של Pazdur מ-FDA (זמינה ברשת בלינק הזה), וגם במאמר שפרסם בכתב העת The Oncologist איש FDA נוסף, Kane, ב-2008, שכותרתו "The Clinical Significance of Statistical Significance".
עוד ראוי לציין בסקירה קצרה זו את השקפים מסדרת הרצאות בביוסטטיסטיקה לקהל הרחב שניתנו על ידי המרצים באוניברסיטת ג'ונס הופקינס, שכבר דיווחתי עליהם לפני מספר שבועות.
הרשימות הקודמות בסדרה
– כשלים סטטיסטיים אפשריים בניסויים קליניים – הקדמה
נשלח: 20 ביולי, 2009. נושאים: ביוסטטיסטיקה, מדע.
תגובות: 4
| טראקבק
