Logistisk regression. Basal Statistik for medicinske PhD-studerende November 2008

Transkript

1 Logistisk regression Basal Statistik for medicinske PhD-studerende November 2008 Bendix Carstensen Steno Diabetes Center, Gentofte & Biostatististisk afdeling, Københavns Universitet

2 Logistisk regression Logistisk regression omhandler analyse af responsvariable der kun har to mulige udfald også kaldet 0-1 variable binære variable ja-nej variable November 2008: Logistisk regression 1

3 Eksempler er: Syg-rask død-levende stor-lille Responsvariablen ønskes forklaret af en eller flere forklarende variable. November 2008: Logistisk regression 2

4 Eksempel på 0-1 variabel Knoglemarvstransplantation på 37 leukæmipatienter, udfaldet er forekomst af acute graft versus host disease, GvHD (DGA, s.361). Obs gvhd donage preg type November 2008: Logistisk regression 3

5 Udfaldet gvhd = { 1 hvis patienten oplevede GvHD 0 hvis patienten ikke oplevede GvHD Forklarende variable: donage: donors alder preg: har donor nogensinde været gravid = { 1 ja 0 nej November 2008: Logistisk regression 4

6 type: leukæmitype = 1 akut myeloid leukæmi (AML) 2 akut lymfatisk leukæmi (ALL) 3 kronisk myeloid leukæmi (CML) Hvilken betydning har de forklarende variable for risikoen for at opleve GvHD? November 2008: Logistisk regression 5

7 Sædvanlig lineær regression Her er responsvariablen y i kvantitativ og vi antager, at den er normalfordelt y i = b 0 + b 1 x 1i + b 2 x 2i + e i, e i N (0, σ 2 ) eller: y i N (b 0 + b 1 x 1i + b 2 x 2i, σ 2 ) Forklarende variable: x 1i, x 2i Regressionskoefficienter: b 0, b 1, b 2 November 2008: Logistisk regression 6

8 Fortolkning af lineær regression: Hvad påvirker størrelse af thymus hos spædbørn: thymus størrelse = dreng+0.35 fødslesvægt i 100 g For et givent køn vokser thymus med 0.35 pr. 100 g fødselsvægt. For en given vægt er thymus 1.06 større hos drenge end hos piger. For et pige barn med vægt lig 0 er den forventede thymus størrelse November 2008: Logistisk regression 7

9 Effekten af de enkelte forklarende variable er betinget af de øvrige variables tilstedeværelse i modellen. Effekten af de forklarende variable er lineær. November 2008: Logistisk regression 8

10 Analyse af 0-1 variabel Responsvariabel binær (0/1) hvordan udtrykkes afhængighed af donors alder (donage), donors graviditetshistorie (preg) og patientens type af leukæmi (type) Model for p = P {GvHD} [0, 1] Upraktisk med p = b 0 + b 1 x 1 + b 2 x 2 + b 3 x 3 November 2008: Logistisk regression 9

11 Transformationer Lidt bedre med ln(p) = b 0 + b 1 x 1 + b 2 x 2 + b 3 x 3 Bedst med logistisk regression som benytter logaritmen (naturlige) til odds ( ) p ln = b 0 + b 1 x 1 + b 2 x 2 + b 3 x 3 1 p November 2008: Logistisk regression 10

12 Logistisk regression - lidt mere præcist logit(p) = ln ( p ) 1 p = b 0 + b 1 x 1 + b 2 x 2 + b 3 x 3 Binære udfald: Y {0, 1} Sandsynlighed: p = P {Y = 1} [0, 1] Odds: ω = p 1 p ω [0, + ] dvs. p = 1 + ω Odds-ratio: OR = p 1 1 p 1 / p2 1 p 2 [0, + ] November 2008: Logistisk regression 11

13 log-odds: logit kaldes også for link-funktionen. logit(p) = ln ( p ) 1 p Lineær prediktor: Prædikteret odds: logit(p) = b 0 + b 1 x 1 + b 2 x 2 + b 3 x 3 = η ω = exp(η) Prædikteret sandsynlighed: p = ω 1 + ω = exp(η) 1 + exp(η) November 2008: Logistisk regression 12

14 Logistisk regression fortolkning To grupper, med sandsynligheder p 1 hhv. p 2 : ( ) p1 logit(p 1 ) logit(p 2 ) = ln ln 1 p 1 = ln ( p1 1 p 1 = ln(or) / p2 1 p 2 ( p2 1 p 2 ) Lineære modeller for logit(p) giver sammenligninger via odds-ratios. November 2008: Logistisk regression 13 )

15 Estimation af regressionskeofficienterne foregår ved en metode kaldet maksimum likelihood estimation. I logistisk regression er denne metode en iterativ procedure som der ikke er nogle simple formler for. Hjælpen er SAS (eller anden statistik software). November 2008: Logistisk regression 14

16 Logistisk regression af GvHD En model kun med den binære forklarende variabel preg (har donor nogensinde været gravid). p = P {GvHD} ( ) p logit(p) = ln = b 0 + b 1 preg 1 p Resulterende model: logit(p) = preg November 2008: Logistisk regression 15

17 Modellen logit(p) = preg udtrykkes som sandsynlighed: p = exp( preg) 1 + exp( preg) = { 0.33 hvis preg= hvis preg=1 November 2008: Logistisk regression 16

18 Binær forklarende variabel Log-odds for GvHD for en patient hvis donor har været gravid (preg=1): ln ( p1 1 p 1 ) = ln(ω 1 ) = b 0 + b 1 1 = b 0 + b 1 Log-odds for GvHD for en patient hvis donor IKKE har været gravid (preg=0): ln ( p0 1 p 0 ) = ln(ω 0 ) = b 0 + b 1 0 = b 0 November 2008: Logistisk regression 17

19 Forskellen i log-odds mellem disse to typer af patienter er: ln(ω 1 ) ln(ω 0 ) = b 0 + b 1 b 0 = b 1 Husk regnereglerne for logaritmer: ln(ω 1 ) ln(ω 0 ) = ln ( ω1 ω 0 ) = b 1 Dvs. odds ratio mellem de to typer af patienter er OR = ω 1 ω 0 = exp(b 1 ) = exp(2.0794) = 8 November 2008: Logistisk regression 18

20 Fortolkningen er, at en patient hvis donor har været gravid har 8 gange større odds for GvHD end en patient hvis donor ikke har været gravid. Donor gravid Ja Nej Total GvHD GvHD Total Odds ratio i denne 2 x 2 tabel beregnes som... Sandsynlighederne for GvHD afhængig af donorerens November 2008: Logistisk regression 19

21 graviditetshistorie... sammenlign med slide nr.??. November 2008: Logistisk regression 20

22 Donor gravid Ja Nej Total GvHD GvHD Total OR = 8/2 9/18 = = 8 p 1 = 8 10 = 0.8, p 0 = 9 27 = 0.33 RR = = 2.4 November 2008: Logistisk regression 21

23 I dette eksempel er værdierne for OR og RR meget forskellige. Hvorfor? Hvis udfaldet er forholdsvis sjældent vil OR og RR ligge tættere i værdi. November 2008: Logistisk regression 22

24 Vi udvider nu med at inkludere donors alder, donage: logit(p) = b 0 + b 1 preg + b 2 donage logit(p) = preg donage Kontrolleret for donors alder er odds ratio for preg nu exp(1.6982) = 5.46, dvs lidt mindre end i den tidligere model. I denne model er der også en antagelse om, at uanset hvilken alder donoren havde vil odds ratio for preg være Hvad er fortolkningen af estimatet for donage? November 2008: Logistisk regression 23

25 Kvantitativ forklarende variabel Fortolkningen af donage hvis donor aldrig har været gravid (preg=0): Log-odds for GvHD for en patient hvis donor var A+1 år: ln ( p1 1 p 1 ) = ln(ω 1 ) = b 0 +b 1 0+b 2 (A+1) = b 0 +b 2 (A+1) Log-odds for GvHD for en patient hvis donor var A år: ln ( p0 1 p 0 ) = ln(ω 0 ) = b 0 + b b 2 A = b 0 + b 2 A November 2008: Logistisk regression 24

26 Forskellen i log-odds mellem disse to typer af patienter er: ln(ω 1 ) ln(ω 0 ) = b 0 +b 2 (A+1) (b 0 +b 2 A) = b 2 = Dvs. OR A+1,A = exp(0.0806) = Når donors alder stiger med 1 år stiger forholdet mellem patienter der får hhv. ikke får GvHD med en faktor Tilsvarende hvis donor har været gravid. November 2008: Logistisk regression 25

27 Fortolkningen af donage hvis donor aldrig har været gravid: Log-odds for GvHD for en patient hvis donor var A+10 år: ( ) p1 ln = ln(ω 1 ) = b 0 +b 1 0+b 2 (A+10) = b 0 +b 2 (A+10 1 p 1 Log-odds for GvHD for en patient hvis donor var A år: ( ) p0 ln = ln(ω 0 ) = b 0 + b 2 A 1 p 0 November 2008: Logistisk regression 26

28 Forskellen i log-odds mellem disse to typer af patienter er: ln(ω 1 ) ln(ω 0 ) = b 0 +b 2 (A+10) (b 0 +b 2 A) = b 2 10 = Dvs. OR A+10,A = exp( ) = exp(0.0806) 10 = = Når donors alder stiger med 10 år stiger forholdet mellem patienter der får hhv. ikke får GvHD med en faktor Tilsvarende hvis donor har været gravid. November 2008: Logistisk regression 27

29 Hvad betyder interceptet b 0? logit(p) = preg er log-odds for GvHD hos en patient hvis donor aldrig har været gravid. logit(p) = preg donage er log-odds for GvHD hos en patient hvis donor aldrig har været gravid og donors alder var 0 år ikke særligt meningsfyldt. Vi vender tilbage til dette senere. November 2008: Logistisk regression 28

30 Konfidensintervaller (Wald type) Som for lineær regression: estimat ± z 1 α/2 std.error Std. error er også noget som maximum likelihood estimationen giver os. Men i logistisk regression er estimaterne log-odds eller log-odds-ratio. November 2008: Logistisk regression 29

31 GvHD data: 95% konfidensinterval for estimat (log-odds-ratio) associeret med donors graviditetshistorie: For odds ratio: ± = ( , ) (exp( ), exp(3.5188)) = (0.885, ) November 2008: Logistisk regression 30

32 95% konfidensinterval for estimat (log-odds-ratio) associeret med 1 års forskel i donors alder: For OR: ± = ( , ) (exp( ), exp(0.1804)) = (0.981, 1.198) 95% konfidensinterval for estimat (log-odds-ratio) associeret med 10 års forskel i donors alder: ± = 10 ( , ) = ( 0.1 November 2008: Logistisk regression 31

33 For OR: (exp( ) 10, exp(0.1804) 10 ) = ( , ) = (0.826, 6 November 2008: Logistisk regression 32

34 Wald test Alternativt kan man teste hypotesen om en regressionskoefficient er lig 0 med Wald χ 2 -testet: X 2 = ( ) 2 estimat χ 2 (1). std.error Hvis χ 2 (1) er større end 3.84 forkastes hypotesen med et signifikansniveau på 5%. November 2008: Logistisk regression 33

35 Test af hypotesen H 0 : ingen association mellem GvHD og donors graviditesthistorie (dvs. teste om estimatet for preg = 0): ( ) X 2 = = , p > Test af hypotesen H 0 : ingen association mellem GvHD og donors alder (dvs. teste om estimatet for donage = 0): X 2 = ( ) = , p > November 2008: Logistisk regression 34

36 GvHD data analyseret i SAS uden Analyst data gvhd; input gvhd donage preg type; cards; ; run; proc logistic data=gvhd; model gvhd(event="1") = preg donage / cl; run; November 2008: Logistisk regression 35

37 Output fra SAS-program The LOGISTIC Procedure Model Information Data Set WORK.GVHD Response Variable gvhd Number of Response Levels 2 Model binary logit Optimization Technique Fisher s scoring Number of Observations Read 37 Number of Observations Used 37 Response Profile Ordered Total Value gvhd Frequency Probability modeled is gvhd=1. November 2008: Logistisk regression 36

38 Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg donage Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits preg donage Wald Confidence Interval for Parameters Parameter Estimate 95% Confidence Limits Intercept preg donage November 2008: Logistisk regression 37

39 Kategoriske forklarende variable preg: har donor nogensinde været gravid = { 1 ja 0 nej Fortolkningen af OR for preg var forskellen i risiko for GvHD mellem preg=1 og preg=0, eller svarende til en forskel på 1 i den forklarende variabel. Men her er det vigtigt at preg var kodet som 0/1. Hvis man vil være sikker i SAS skal man benytte et såkaldt class statement. November 2008: Logistisk regression 38

40 SAS: class statement proc logistic data=gvhd; class preg / param=ref; model gvhd(event="1")=preg; run; Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits preg 0 vs November 2008: Logistisk regression 39

41 Estimatet for preg er det samme som tidligere men med minus foran og OR er den recibrokke af den tidligere OR. Interceptet er også ændret: Uden class statement: logit(p) = preg OR = exp(2.0794) = Med class statement: logit(p) = preg OR = exp( ) = November 2008: Logistisk regression 40

42 Dette skyldes, at SAS som default vælger den største værdi af en klassevariabel som referencekategori, i dette tilfælde preg = 1. Hvad betyder interceptet i de to modeller? (hhv og ) November 2008: Logistisk regression 41

43 Man kan vælge reference med ref="" (Husk citationstegn også når variablen er numerisk!) proc logistic data=gvhd; class preg(ref="0") / param=ref; model gvhd(event="1")=preg; run; Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits preg 1 vs November 2008: Logistisk regression 42

44 Variable med mere end to kategorier type: leukæmitype = 1 akut myeloid leukæmi (AML) 2 akut lymfatisk leukæmi (ALL) 3 kronisk myeloid leukæmi (CML) proc logistic data=gvhd; model gvhd(event="1")=type; run; Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept type Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits November 2008: Logistisk regression 43

45 type November 2008: Logistisk regression 44

46 SAS: class statement proc logistic data=gvhd; class type / param=ref; model gvhd(event="1")=type; run; Type III Analysis of Effects Wald Effect DF Chi-Square Pr > ChiSq type Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept type type Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits type 1 vs type 2 vs November 2008: Logistisk regression 45

47 Valg af akut lymfatisk leukæmi som referencekategori: proc logistic data=gvhd; class type(ref="2") / param=ref; model gvhd(event="1")=type; run; Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept type type Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits type 1 vs type 3 vs November 2008: Logistisk regression 46

48 SAS class statement genererer automatisk to binære variable (indikatorvariable) for de kategorier som ikke er reference: I{type=1} = Modellen bliver så: { 1 hvis type = 1 0 ellers I{type=3} = logit(p) = b 0 + b 1 I{type=1} + b 2 I{type=3} = I{type=1} I{type=3} { 1 hvis ty 0 ellers November 2008: Logistisk regression 47

49 Log-odds for GvHD for en patient med akut myeloid leukæmi (type=1) logit(p 1 ) = ln(ω 1 ) = b 0 + b b 2 0 = b 0 + b 1 Log-odds for GvHD for en patient med akut lymfatisk lekæmi (type=2) logit(p 2 ) = ln(ω 2 ) = b 0 + b b 2 0 = b 0 Forskellen i log-odds mellem disse to typer af patienter er: ln(ω 1 ) ln(ω 2 ) = b 0 + b 1 b 0 = b 1 November 2008: Logistisk regression 48

50 Dvs. odds ratio mellem AML og ALL er OR AML vs. ALL = ω 1 ω 2 = exp(b 1 ) = exp(0.9163) = 2.5 Tilsvarende er odds ratio mellem CML og ALL OR CML vs. ALL = exp(b 2 ) = exp(2.4849) = 12 Hvad betyder interceptet? November 2008: Logistisk regression 49

51 Log-odds for GvHD for en patient med AML (type=1) logit(p 1 ) = ln(ω 1 ) = b 0 + b b 2 0 = b 0 + b 1 Log-odds for GvHD for en patient med CML (type=3) logit(p 2 ) = ln(ω 2 ) = b 0 + b b 2 1 = b 0 + b 2 Forskellen i log-odds mellem disse to typer af patienter er: ln(ω 1 ) ln(ω 2 ) = b 0 + b 1 (b 0 + b 2 ) = b 1 b 2 Dvs. odds ratio mellem AML og CML er OR AML vs. CML = ω 1 ω 2 = exp(b 1 b 2 ) = exp( ) = exp( November 2008: Logistisk regression 50

52 Wald test for kategoriske forklarende variable Det Wald χ 2 -test (med 1 frihedsgrad) vi tidligere har set på var beregnet for hver parameterestimat for sig. Med en kategorisk forklarende variabel med mere end to niveauer vil vi også gerne udtale os om variablen er statistisk signifikant associeret til risikoen for responsen. Til dette findes en version af Wald χ 2 -testet med antal frihedsgrader lig antal af kategorier minus 1. Dette kan man også kalde et test for uafhængighed mellem variablen og responsen. November 2008: Logistisk regression 51

53 For variablen type fra GvHD eksemplet er antallet af kategorier 3 så Wald testet for hypotensen om ingen sammenhæng mellem GvHD og type af leukæmi vil have 2 frihedsgrader. Dette svarer også til simultant at teste, at begge parameterestimater for type er lig 0 eller at teste om alle tre kategorier har samme risiko for GvHD. Heldigvis beregner SAS også dette for os (i SAS kaldet Type III analysis ). Det har ingen betydning for testet, hvilken kategori der er blevet anvendt som reference: November 2008: Logistisk regression 52

54 proc logistic data=gvhd; class type / param=ref; model gvhd(event="1") = type; run; Type III Analysis of Effects Wald Effect DF Chi-Square Pr > ChiSq type proc logistic data=gvhd; class type(ref="2") / param=ref; model gvhd(event="1")=type; run; Type III Analysis of Effects Wald Effect DF Chi-Square Pr > ChiSq type November 2008: Logistisk regression 53

55 Effekt af centrering af kvantitativ forklarende variabel For GvHD data havde vi modellen logit(p) = preg donage. Interceptet er log-odds for GvHD for en patient hvis donor aldrig har været gravid og donors alder var 0 år. Centrerer vi donage omkring gennemsnitsalder for donorer (som er 26 år) er interceptet log-odds for GvHD for en patient hvis donor aldrig har været gravid og donors alder var 26 år: November 2008: Logistisk regression 54

56 data gvhd2; set gvhd; donage26=donage-26; run; proc logistic data=gvhd2; model gvhd(event="1")=preg donage26; run; The LOGISTIC Procedure Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg donage November 2008: Logistisk regression 55

57 Hvis kovariaterne centreres omkring en værdi: ændres estimaterne ikke ændres standardafvigelsen ikke Wald s test og p-værdi forbliver den samme Interceptet kommer til at referere til log-odds for den værdi af kovariaterne man centrerer omkring. November 2008: Logistisk regression 56

58 Interaktion Modellen fra GvHD eksemplet: logit(p) = b 0 + b 1 preg + b 2 donage26 antager, at effekten af donors alder på risikoen for GvHD er den samme blandt donorer som har været hhv. ikke har været gravide. Dette bør vi teste. Dette gøres typisk ved at tilføje en ekstra variable interact som er produktet mellem preg og donage26: interact = preg*donage26 November 2008: Logistisk regression 57

59 Dvs. interact = { donage26 hvis donor har været gravid 0 hvis donor ikke har været gravid November 2008: Logistisk regression 58

60 Modellen bliver logit(p) = b 0 + b 1 preg + b 2 donage26 + b 3 interact b 1 er forskellen i log-odds mellem preg=1 og preg=0 for en donor med en alder på 26 år. b 2 er effekten af donage26 blandt donorer som IKKE har været gravide. b 3 er den ekstra effekt donage26 har blandt donorer som har været gravide ud over b 2. Dvs. hvis denne effekt er lig 0 vil effekten af donage26 være den samme for donorer der har hhv. ikke har været gravide. November 2008: Logistisk regression 59

61 proc logistic data=gvhd; class preg(ref="0") / param=ref; model gvhd(event="1")=preg donage26 interact; run; Type 3 Analysis of Effects Wald Effect DF Chi-Square Pr > ChiSq preg donage interact <- TEST FOR INGEN INTER Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg donage interact November 2008: Logistisk regression 60

62 proc logistic data=gvhd; class preg(ref="0") / param=ref; model gvhd(event="1")=preg donage26 preg*donage26; < run; LIDT LETTERE Type III Analysis of Effects Wald Effect DF Chi-Square Pr > ChiSq preg donage donage26*preg Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg donage donage26*preg November 2008: Logistisk regression 61

63 Alternativ parametrisering til interaktion To nye variable: donage26 notpreg = donage26 preg = { donage26 hvis donor aldrig gravid 0 hvis donor tidl. gravid { 0 hvis donor aldrig gravid donage26 hvis donor tidl. gravid Modellen skal så være logit(p) = b 0 +b 1 preg+b 2 donage26 notpreg+b 3 donage26 November 2008: Logistisk regression 62

64 logit(p) = b 0 +b 1 preg+b 2 donage26 notpreg+b 3 donage26 b 1 er forskellen i log-odds mellem preg=1 og preg=0 for en donor med en alder på 26 år. b 2 er effekten af donage26 blandt donorer som IKKE har været gravide. b 3 er nu effekten af donage26 blandt donorer som HAR været gravide. November 2008: Logistisk regression 63

65 data gvhd2; set gvhd; donage26_notpreg=donage26*(preg=0); donage26_preg=donage26*(preg=1); run; proc logistic data=gvhd2; class preg(ref="0") / param=ref; model gvhd(event="1")=preg donage26_notpreg donage26_preg; Interaction: test donage26_notpreg=donage26_preg; <- TEST FOR INGEN INTERAKTION run; November 2008: Logistisk regression 64

66 Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept preg donage26_notpreg donage26_preg Odds Ratio Estimates Point 95% Wald Effect Estimate Confidence Limits preg 1 vs donage26_notpreg donage26_preg Linear Hypotheses Testing Results Wald Label Chi-Square DF Pr > ChiSq Interaction <- TEST FOR INGEN INTERA November 2008: Logistisk regression 65

67 Ordnede kategoriske forklarende variable Data fra DGA s. 261: Sammenhæng mellem kejsersnit og skostørrelse (skostørrelse er en simpel indikator for størrelse af bækken): Skonummer Kejsersnit < Ialt Ja Nej I alt Odds for kejsersnit er 0.29, 0.25, 0.17, 0.17, 0.17, 0.07 for stigende skostørrelse. November 2008: Logistisk regression 66

68 data sko; input cs $ skonr antal; cards; Y Y Y Y Y Y N N N N N N ; run; proc logistic data=sko descending; class skonr / param=ref; model cs=skonr; weight antal; run; November 2008: Logistisk regression 67

69 Model Fit Statistics Intercept Intercept and Criterion Only Covariates AIC SC Log L Testing Global Null Hypothesis: BETA=0 Test Chi-Square DF Pr > ChiSq Likelihood Ratio Score Wald Type 3 Analysis of Effects Effect DF Chi-Square Pr > ChiSq skonr Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept skonr skonr skonr skonr skonr November 2008: Logistisk regression 68

70 proc logistic data=sko descending; model cs=skonr; weight antal; run; Model Fit Statistics Intercept Intercept and Criterion Only Covariates AIC SC Log L Testing Global Null Hypothesis: BETA=0 Test Chi-Square DF Pr > ChiSq Likelihood Ratio Score Wald Analysis of Maximum Likelihood Estimates Standard Wald Parameter DF Estimate Error Chi-Square Pr > ChiSq Intercept skonr <- TEST November 2008: Logistisk regression 69

71 Likelihood ratio test Likelihood-ratio er forholdet mellem likelihood funktionens maximum under to forskellige modeller, som alene adskiller sig ved at den mindste mangler en eller flere parametre (nestede modeller). I SAS skal man køre de to modeller hver for sig og derefter trække værdien af -2 Log L Intercept and Covariates for den største model fra -2 Log L Intercept and Covariates fra den mindste model. Dette tal skal vurderes i en χ 2 -fordeling med antal frihedsgrader lig forskellen i frihedsgrader (DF) i de to modeller. November 2008: Logistisk regression 70

72 Test for linearitet For at undersøge om den lineære model er acceptabel skal vi sammenligne de to modeller Model 1: skonr som en class variabel Model 2: skonr som en kvantitativ variabel Forskellen i -2 Log L Intercept and Covariates er (model 2) - (model 1) = = November 2008: Logistisk regression 71

73 Antal frihedsgrader findes under overskriften Testing Global Null Hypothesis: BETA=0 : Dvs. DF model 1 DF model 2 = 5 1 = 4. Likelihood ratio test = χ 2 (4) p = Testet er IKKE signifikant så vi accepterer den lineære model. November 2008: Logistisk regression 72

74 Beregning af p-værdi i SAS data; p=1-probchi(1.785,4); put p; run; LOG VINDUE data; 41 p=1-probchi(1.785,4); 42 put p; 43 run; NOTE: The data set WORK.DATA4 has 1 observations and 1 variables. NOTE: DATA statement used (Total process time): real time 0.01 seconds cpu time 0.01 seconds November 2008: Logistisk regression 73

75 Præsentation af resultater fra logistisk regression Typisk vil man præsentere odds ratio med tilhørende 95% confidensintervaller. For klassevariable vil man også supplere med en p-værdi fra testet om uafhængighed mellem variablen og resonsen. Nogle tidsskrifter forlanger også p-værdier for hvert estimat men dette er unødvendigt da confidensintervallet indeholder samme information. November 2008: Logistisk regression 74

76 Case-kontrol studier I et case-kontrol-studie udvælges: cases (sygdomstilfælde) som er verificeret fra et register eller lignende kontroller, som er personer der repræsenterer den population hvorfra cases stammer. Personer i case-kontrol-studier udvælges altså på baggrund af udfaldet. Typisk vil man på forhånd fastsætte forholdet mellem antallet af cases og kontroller. November 2008: Logistisk regression 75

77 Hvis en variabel har betydning for sygdommens udvikling: Forskellig fordeling af variablen mellem cases og kontroller. Sandsynligheden for at være en case (i populationen), p{sygdom} kan ikke estimeres ud fra et case-kontrol studie. Men effekten af kovariaterne på sygdomssandsynligheden kan! November 2008: Logistisk regression 76

78 Case-kontrol studier I populationen: p = P {case} p 1 p = odds(case) Udvælgelsesbrøker, dvs. inklusionssandsynligheder π 0 og π 1 : P {inklusion i studiet case} = π 1 P {inklusion i studiet kontrol} = π 0 November 2008: Logistisk regression 77

79 I et case-kontrol studie observerer man antallet af cases og antallet af kontroller, betinget af at disse faktisk er med i studiet. Afhænger af diverse kovariater (det er det man interesseret i) og inklusionssandsynlighederne (som man ikke er interesseret i). November 2008: Logistisk regression 78

80 p case π 1 1 π 1 inkluderet 1 p kontrol π 0 1 π 0 inkluderet P {case & inkl.} = p π 1 P {kontrol & inkl.} = (1 p) π 0 p π 1 odds(case inkl.) = = p (1 p) π 0 1 p π 1 π 0 November 2008: Logistisk regression 79

81 Logistisk regression Model for populationen: [ ] p ln 1 p = b 0 + b 1 x 1 + b 2 x 2 Model for det observerede: [ ] p ln[odds(case inkl.)] = ln + ln 1 p ( [ ] ) π1 = ln + b 0 π 0 [ π1 π 0 ] + b 1 x 1 + b 2 x 2 November 2008: Logistisk regression 80

82 Analyse af P {case inklusion} dvs. binære observationer: Y = { 1 case 0 kontrol Effekt af kovariater estimeres korrekt. Intercept uden mening. afhænger af π 0 og π 1 der sædvanligvis er ukendte. November 2008: Logistisk regression 81