28.6 – 4.7 · ~7 שעות · המטרה השבוע: לעגן את שני נושאי העומק שכבר נכתבו, להפעיל active recall, להקים R, ולעשות אבחון עצמי שמכייל את כל שאר התוכנית.
המבחן ב-CS1 הוא באנגלית — לכן ההסבר כאן בעברית, אבל כל מונח מקצועי מופיע באנגלית כפי שתפגוש אותו בנייר הבחינה.
| # | מה | כמה | קישור |
|---|---|---|---|
| 1 | קריאה פעילה של חומר העומק ב-Credibility | 2ש' | depth-credibility-theory.html |
| 2 | 21 הכרטיסים של Credibility — active recall | 1ש' | flashcards |
| 3 | קריאה פעילה של חומר העומק ב-GLM | 2ש' | depth-glm.html |
| 4 | הקמת R + RStudio וחימום | 1ש' | ראה למטה |
| 5 | אבחון עצמי (6 שאלות) | 1ש' | ראה למטה |
טיפ קצב: אל תקרא את חומרי העומק כמו רומן. בכל גזירה — עצור, כסה את ההמשך, ונסה לגזור בעצמך. אם נתקעת, זה בדיוק הנושא שצריך זמן. סמן אותו.
אתה מכיר R מהתואר, אז זה רענון סביבה, לא לימוד. רק לוודא שהכל מוכן ל-CS1B (שנפתר ב-R):
# התקנה: R מ-cran.r-project.org + RStudio Desktop (חינם)
# חימום של 10 דקות — לוודא שהכל רץ:
data(cars) # דאטהסט מובנה
fit <- lm(dist ~ speed, cars) # רגרסיה לינארית
summary(fit) # לקרוא: coefficients, R^2, residuals
glm(dist ~ speed, data=cars, family=gaussian) # אותו דבר כ-GLM
qqnorm(resid(fit)); qqline(resid(fit)) # בדיקת נורמליות
פונקציות ליבה ל-CS1B לוודא שאתה שולף בלי לחשוב: lm() glm() summary() predict() qqnorm() dnorm/pnorm/qnorm t.test() chisq.test() aov().
איך: ספר עצור, ~10 דק' לשאלה. כתוב פתרון מלא לפני שאתה מציץ. המטרה היא לא ציון — אלא למפות איפה אתה חלק ואיפה חלוד, כדי שנכוון את שבועות 3–7. בסוף יש מפתח כיול.
נתון מדגם בלתי-תלוי $X_1,\dots,X_n \sim \text{Exponential}(\lambda)$ עם צפיפות $f(x)=\lambda e^{-\lambda x}$. גזור את אומד הנראות המקסימלית $\hat\lambda$.
לאומד מהשאלה הקודמת — האם $\hat\lambda$ חסר-הטיה (unbiased)? אם לא, לאיזה כיוון ההטיה? (רמז: $E[1/\bar X] \neq 1/E[\bar X]$.)
מדגם $n=25$ מהתפלגות נורמלית, ממוצע מדגמי $\bar x = 50$, סטיית תקן מדגמית $s=8$. בנה רווח סמך 95% לתוחלת. איזו התפלגות אתה משתמש בה ולמה?
ה-MGF של $X\sim\text{Poisson}(\mu)$ הוא $M_X(t)=e^{\mu(e^t-1)}$. השתמש בו כדי לגזור את $E[X]$ ואת $\text{Var}(X)$.
$N\sim\text{Poisson}(\lambda)$ הוא מספר התביעות, וכל תביעה $Y_i$ עם תוחלת $\mu$ ושונות $\sigma^2$ (בלתי-תלויות). $S=\sum_{i=1}^{N}Y_i$ הוא סך התביעות (compound distribution). מצא את $E[S]$ ואת $\text{Var}(S)$.
מטבע נזרק 100 פעמים ויצא "עץ" 60 פעמים. בדוק ב-$\alpha=0.05$ אם המטבע הוגן. נסח $H_0,H_1$, חשב את הסטטיסטי, והסק.
ש1. $L(\lambda)=\prod \lambda e^{-\lambda x_i}=\lambda^n e^{-\lambda\sum x_i}$. לוג-נראות $\ell=n\ln\lambda - \lambda\sum x_i$. גזירה והשוואה לאפס: $\frac{n}{\lambda}-\sum x_i=0 \Rightarrow \boxed{\hat\lambda = n/\sum x_i = 1/\bar X}$.
ש2. מוטה (biased). מ-Jensen, כיוון ש-$1/x$ קמורה, $E[1/\bar X] > 1/E[\bar X]=\lambda$ — האומד מטה כלפי מעלה (overestimates). ההטיה דועכת כ-$O(1/n)$, כך שהאומד עדיין consistent. (זו בדיוק נקודה שבוחני IFoA אוהבים: MLE consistent אבל לא בהכרח unbiased.)
ש3. $\sigma$ לא ידועה ו-$n$ קטן → התפלגות t עם $n-1=24$ דרגות חופש. $\bar x \pm t_{24,0.975}\cdot s/\sqrt n = 50 \pm 2.064 \cdot 8/5 = 50 \pm 3.30 = \boxed{(46.70,\ 53.30)}$.
ש4. $E[X]=M'(0)$. $M'(t)=e^{\mu(e^t-1)}\cdot\mu e^t$, ב-$t=0$: $\mu$. ל-variance: $M''(t)=\mu e^t M(t)+\mu e^t M'(t)$, ב-$t=0$: $\mu + \mu^2 = E[X^2]$. לכן $\text{Var}=E[X^2]-(E X)^2=\mu+\mu^2-\mu^2=\boxed{\mu}$. (תוחלת=שונות — חתימת פואסון.)
ש5. חוקי התוחלת/שונות הכוללת לפי $N$: $E[S]=E[N]\,E[Y]=\lambda\mu$. $\text{Var}(S)=E[N]\text{Var}(Y)+\text{Var}(N)\,(E Y)^2=\lambda\sigma^2+\lambda\mu^2=\boxed{\lambda(\sigma^2+\mu^2)}$. (זו תוצאת ה-compound Poisson — ליבת תורת הסיכון, תופיע שוב ב-CS2.)
ש6. $H_0:p=0.5$ מול $H_1:p\neq0.5$ (דו-צדדי). תחת $H_0$: $\hat p=0.6$, ש"ת $=\sqrt{0.5\cdot0.5/100}=0.05$. $z=(0.6-0.5)/0.05=2.0$. ערך קריטי $1.96$. כיוון ש-$2.0>1.96$ → דוחים את $H_0$ (בקושי). p-value $\approx 0.0455$.
| ביצוע | משמעות | פעולה |
|---|---|---|
| 5–6 חלק | Inference/Distributions חזקים אצלך | שבועות 3–5 = רענון מהיר, להעביר זמן ל-GLM/Credibility |
| 3–4 | בסיס טוב, חלודה נקודתית | להיצמד לקצב המתוכנן |
| 0–2 | צריך רענון יסודי | להוסiv שעה/שבוע ל-Inference, ולומר לי — אבנה חומר עומק ל-Inference |
כשתסיים את האבחון — תגיד לי כמה יצאו ואיפה נתקעת. זה משנה את התוכנית בפועל: אם נושא מסוים חלוד, אבנה לו שכבת עומק (כמו שעשינו ל-Credibility ו-GLM). זה הלולאה הדו-כיוונית — אתה מסמן ומספר, אני מתאים.