שבוע 1 — נקודת הזינוק · CS1

28.6 – 4.7 · ~7 שעות · המטרה השבוע: לעגן את שני נושאי העומק שכבר נכתבו, להפעיל active recall, להקים R, ולעשות אבחון עצמי שמכייל את כל שאר התוכנית.

המבחן ב-CS1 הוא באנגלית — לכן ההסבר כאן בעברית, אבל כל מונח מקצועי מופיע באנגלית כפי שתפגוש אותו בנייר הבחינה.


איך לעבוד השבוע — לפי הסדר

# מה כמה קישור
1 קריאה פעילה של חומר העומק ב-Credibility 2ש' depth-credibility-theory.html
2 21 הכרטיסים של Credibility — active recall 1ש' flashcards
3 קריאה פעילה של חומר העומק ב-GLM 2ש' depth-glm.html
4 הקמת R + RStudio וחימום 1ש' ראה למטה
5 אבחון עצמי (6 שאלות) 1ש' ראה למטה

טיפ קצב: אל תקרא את חומרי העומק כמו רומן. בכל גזירה — עצור, כסה את ההמשך, ונסה לגזור בעצמך. אם נתקעת, זה בדיוק הנושא שצריך זמן. סמן אותו.


4 · הקמת R — צ'ק-ליסט מהיר

אתה מכיר R מהתואר, אז זה רענון סביבה, לא לימוד. רק לוודא שהכל מוכן ל-CS1B (שנפתר ב-R):

# התקנה: R מ-cran.r-project.org + RStudio Desktop (חינם)
# חימום של 10 דקות — לוודא שהכל רץ:
data(cars)                      # דאטהסט מובנה
fit <- lm(dist ~ speed, cars)   # רגרסיה לינארית
summary(fit)                    # לקרוא: coefficients, R^2, residuals
glm(dist ~ speed, data=cars, family=gaussian)   # אותו דבר כ-GLM
qqnorm(resid(fit)); qqline(resid(fit))          # בדיקת נורמליות

פונקציות ליבה ל-CS1B לוודא שאתה שולף בלי לחשוב: lm() glm() summary() predict() qqnorm() dnorm/pnorm/qnorm t.test() chisq.test() aov().


5 · אבחון עצמי — 6 שאלות

איך: ספר עצור, ~10 דק' לשאלה. כתוב פתרון מלא לפני שאתה מציץ. המטרה היא לא ציון — אלא למפות איפה אתה חלק ואיפה חלוד, כדי שנכוון את שבועות 3–7. בסוף יש מפתח כיול.

שאלה 1 — MLE (Inference)

נתון מדגם בלתי-תלוי $X_1,\dots,X_n \sim \text{Exponential}(\lambda)$ עם צפיפות $f(x)=\lambda e^{-\lambda x}$. גזור את אומד הנראות המקסימלית $\hat\lambda$.

שאלה 2 — תכונות אומד (Inference)

לאומד מהשאלה הקודמת — האם $\hat\lambda$ חסר-הטיה (unbiased)? אם לא, לאיזה כיוון ההטיה? (רמז: $E[1/\bar X] \neq 1/E[\bar X]$.)

שאלה 3 — רווח סמך (Inference)

מדגם $n=25$ מהתפלגות נורמלית, ממוצע מדגמי $\bar x = 50$, סטיית תקן מדגמית $s=8$. בנה רווח סמך 95% לתוחלת. איזו התפלגות אתה משתמש בה ולמה?

שאלה 4 — MGF (Distributions)

ה-MGF של $X\sim\text{Poisson}(\mu)$ הוא $M_X(t)=e^{\mu(e^t-1)}$. השתמש בו כדי לגזור את $E[X]$ ואת $\text{Var}(X)$.

שאלה 5 — שונות כוללת (Distributions)

$N\sim\text{Poisson}(\lambda)$ הוא מספר התביעות, וכל תביעה $Y_i$ עם תוחלת $\mu$ ושונות $\sigma^2$ (בלתי-תלויות). $S=\sum_{i=1}^{N}Y_i$ הוא סך התביעות (compound distribution). מצא את $E[S]$ ואת $\text{Var}(S)$.

שאלה 6 — מבחן השערות (Inference)

מטבע נזרק 100 פעמים ויצא "עץ" 60 פעמים. בדוק ב-$\alpha=0.05$ אם המטבע הוגן. נסח $H_0,H_1$, חשב את הסטטיסטי, והסק.


פתרונות

ש1. $L(\lambda)=\prod \lambda e^{-\lambda x_i}=\lambda^n e^{-\lambda\sum x_i}$. לוג-נראות $\ell=n\ln\lambda - \lambda\sum x_i$. גזירה והשוואה לאפס: $\frac{n}{\lambda}-\sum x_i=0 \Rightarrow \boxed{\hat\lambda = n/\sum x_i = 1/\bar X}$.

ש2. מוטה (biased). מ-Jensen, כיוון ש-$1/x$ קמורה, $E[1/\bar X] > 1/E[\bar X]=\lambda$ — האומד מטה כלפי מעלה (overestimates). ההטיה דועכת כ-$O(1/n)$, כך שהאומד עדיין consistent. (זו בדיוק נקודה שבוחני IFoA אוהבים: MLE consistent אבל לא בהכרח unbiased.)

ש3. $\sigma$ לא ידועה ו-$n$ קטן → התפלגות t עם $n-1=24$ דרגות חופש. $\bar x \pm t_{24,0.975}\cdot s/\sqrt n = 50 \pm 2.064 \cdot 8/5 = 50 \pm 3.30 = \boxed{(46.70,\ 53.30)}$.

ש4. $E[X]=M'(0)$. $M'(t)=e^{\mu(e^t-1)}\cdot\mu e^t$, ב-$t=0$: $\mu$. ל-variance: $M''(t)=\mu e^t M(t)+\mu e^t M'(t)$, ב-$t=0$: $\mu + \mu^2 = E[X^2]$. לכן $\text{Var}=E[X^2]-(E X)^2=\mu+\mu^2-\mu^2=\boxed{\mu}$. (תוחלת=שונות — חתימת פואסון.)

ש5. חוקי התוחלת/שונות הכוללת לפי $N$: $E[S]=E[N]\,E[Y]=\lambda\mu$. $\text{Var}(S)=E[N]\text{Var}(Y)+\text{Var}(N)\,(E Y)^2=\lambda\sigma^2+\lambda\mu^2=\boxed{\lambda(\sigma^2+\mu^2)}$. (זו תוצאת ה-compound Poisson — ליבת תורת הסיכון, תופיע שוב ב-CS2.)

ש6. $H_0:p=0.5$ מול $H_1:p\neq0.5$ (דו-צדדי). תחת $H_0$: $\hat p=0.6$, ש"ת $=\sqrt{0.5\cdot0.5/100}=0.05$. $z=(0.6-0.5)/0.05=2.0$. ערך קריטי $1.96$. כיוון ש-$2.0>1.96$ → דוחים את $H_0$ (בקושי). p-value $\approx 0.0455$.


מפתח כיול — מה לעשות עם התוצאה

ביצוע משמעות פעולה
5–6 חלק Inference/Distributions חזקים אצלך שבועות 3–5 = רענון מהיר, להעביר זמן ל-GLM/Credibility
3–4 בסיס טוב, חלודה נקודתית להיצמד לקצב המתוכנן
0–2 צריך רענון יסודי להוסiv שעה/שבוע ל-Inference, ולומר לי — אבנה חומר עומק ל-Inference

כשתסיים את האבחון — תגיד לי כמה יצאו ואיפה נתקעת. זה משנה את התוכנית בפועל: אם נושא מסוים חלוד, אבנה לו שכבת עומק (כמו שעשינו ל-Credibility ו-GLM). זה הלולאה הדו-כיוונית — אתה מסמן ומספר, אני מתאים.