顯示具有 統計 標籤的文章。 顯示所有文章

Pearson's Chi-squared test with Yates' continuity correction

今天試用在新思惟買的MedCalc,真的是一個很便宜實惠的軟体

試跑一個chi-squared test
還蠻方便的,不過因為按起來不還不是很順手,所以又拿spss來用
咦?結果居然不一樣。再用prism 6算一下,難道是medcalc錯了?

只好google一下,用R來測試
R的結果和medcalc想同。才發現原來是叫做Yates' continuity correction的東西。

後來到medcalc的網頁上查詢,原來上面就有寫到,在 2x2的table,medcalc會使用 Yates' correction for continuity來計算。
因為這個的公式是 [((observed-model)-0.5)^2] / model,所以他算出來的chi square會比較小,會比較不顯著(p值比較大)。
2015年10月13日 星期二
Posted by Chih-Hao Chang
Tag :

讀書心得 聰明學統計的13又½堂課


統計已經是發展很久的學問,但是很多人聽到統計就會感覺得高深莫測,或者對統計有所畏懼。想知道統計學家的故事可以參考統計改變了世界這本書。而這本聰明學統計的目的是讓大家了解不要誤用統計,畢竟任何人拿套裝軟体(excel, Stata, SAS, R, SPSS) 都可以跑統計了。
這本書寫的很好,解釋的比黑天鵝或隨機騙局還清楚。

作者說統計的警探工作就是分辨重要關係。例如在20週年同學會上,可以把畢業同學有吸菸或沒有吸菸得到癌症的比率拿來分析嗎?當然是不行因為已經往生的吸菸者不會來參加了。所以畢業越久的同學會,數據偏差越嚴重。

而統計的一開始,就是描述性統計,把一堆數字變成一個簡化的數字,不管是使用mean or median,都有其各自解讀的意義(或者作者有意讓讀者接收的訊息)。有時也可以使用相對數字(和其他人比較),或者ratio(百分之幾)讓人更了解。

數據不會說謊,不過有些是胡言亂語。許多統計的詭計來自蘋果和橘子的比較。例如不計通貨膨脹(貨幣的時間價值),或是以低基期來強調高成長率,或是老闆和員工都加薪百分之十,都繳一樣的稅率(或許老闆的稅率更低)。或是把切切在高點,不管是一年、五年報酬率都很可觀。
在2007年時就有看過報紙寫投資十年獲利800%。(可搜尋美林世界礦業基金就知道)


相關性,兩個變數有關連,越接近1或-1關連越強。被拿來推薦您可能喜歡的東西,不過不代表因果關係(大數據一書也有提到)。

各自獨立事件的機率可以相乘,但是像今天下雨和明天下雨就不是獨立事件,今年撞壞車子保費會被調高,因為今年和明年撞壞也不是獨立事件。
左邊發動機故障+右邊發動機故障是獨立事件嗎?

期望值:期望值是負的,還是有可能賺錢。所以壞的決策有可能是好結果,好的決策也可能是壞結果。
包牌的人,是否因為大數法則,得到的錢越接近期望值?

作者提到誤用統計的時候:
當事件並不是獨立事件時,卻假設它們是
當事件屬獨立事件時沒發現
群集的確會發生

數據不當包括:
選樣偏差 (民調)
刊登偏差
回憶偏差 (Daniel Kahneman: The riddle of experience vs. memory)
存活者偏差 (各種基金)

標準差:衡量母體的分布性
標準誤:衡量樣本平均數的分布性

normal distribution
T distribution: small sample, 有fat tail,可使用T Distribution Calculator計算
或使用R
qt(0.95,df=22)

公式:
變異數=標準差^2= ((x1-μ)^2+(x2-μ)^2....+(xn-μ)^2) / n
相關係數 = 1/n ∑ (xi-X平均)(yi-Y平均)/ (σx)(σy)
SE=s/ √n
chi-square=(n-1)*S^2/(σ^2)

2015-3-16 update:


2015-7-23 update:

書裡有寫到,他觀察柯林頓從政以來的公開講話,觀察次數是幾千次,觀察時間十多年,發現柯林頓都不會死。所以顯示柯林頓被認定是不會死的。

2015年3月2日 星期一
Posted by Chih-Hao Chang

Logistic regression 迴歸整理

ln (p/ (1-p) ) = b0+b1X
p= e ^ (b0+b1X) / (1+ (e^(b0+b1X)))

書裡寫到在logistic regression可以 report 的data 有
beta value, standard error, P value, R square (Hosmer & Lemeshow) and  goodness-of-fit statistics. odd ratio, confidence interval. constant.

Omnibus tests of models coefficient table
看chi-square是否適合,若p 小於0.05表示這個model可以。但是比較多個不同的model,找出 most parsimonious model.

odds= P(cure) / (1-P(cure))
odds ratio (exponential of B, exp (B)) = (odds after a unit changes in the predictor) / (original odds)

R square = ( (-2LL(baseline)) - (-2LL (new) ) ) / (-2LL (baseline))

最好每一個cell 都有variables
complete separation:如果可以用一個predictor來預測outcome就不適用
一個predictor需要10個case (? or 50?)

Method of regression
Enter: 每一個項目都放到model裡
forward, backward就是照他字面上的意思,把變數加入或把變數剔除。

logistic regression 和 discriminant analysis 的差異
discriminant analysis:需normally distributed 的 independent variable
logistic regression :需要足夠的 sample

multivariate analysis: 2個 dependent variables
multivariable analysis: 多個 independent variables

常見的迴歸錯誤(來自聰明學統計一書):
分析非線性關係、相關性不等於因果關係、顛倒的因果、遺漏變數偏誤、高度相關的解釋變數、超出資料範圍的推測、資料地雷(太多變數)

參考資料:
Discovering Statistics using IBM SPSS Statistics (4版)
Exploratory regression analysis: A tool for selecting models and determining predictor importance
What is the difference between Logistic Regression and Discriminant Analysis?
Multivariate or Multivariable Regression?


2015-8-10 update:
為何增加一個變數後原先的變數會變成沒有意義

2015年1月26日 星期一
Posted by Chih-Hao Chang
Tag :

Sample size calculation 摘要



http://www.ncbi.nlm.nih.gov/pubmed/19303160

Heparanase inhibitor PI-88 as adjuvant therapy for hepatocellular carcinoma after curative resection: a randomized phase II trial for safety and optimal dosage
未治療 recurrence free 50%, 160mg recurrence free 63%


計算sample size,參考 ptt好文。
https://www.ptt.cc/bbs/Stock/M.1408343067.A.CCB.html

需要
1. significance level (α) ,通常0.05
2. power (1-β) ,通常0.8
3. expected treatment difference (δ) 依照前期的資料
4. expected standard deviation (σ) 依照前期的資料

檢力(power):在治療的確有作用的情況下,能推翻虛無假說的機率
影響檢力的因素 (簡明生物統計學):
第一型錯誤α的大小
療效大小
母體變異度
樣本數越大,檢力越大

sample size calculation (公式參考)
http://web.stanford.edu/~kcobb/hrp259/lecture11.ppt

website
http://www.surveysystem.com/sscalc.htm
http://www.raosoft.com/samplesize.html
http://www.openepi.com/SampleSize/SSCohort.htm
http://www.openepi.com/SampleSize/SSMean.htm (連續變數)



本資料由 (上櫃公司) 基亞  公司提供

序號  1發言日期  103/07/29發言時間  12:01:46
發言人  歐朝銓發言人職稱  管理部副總發言人電話  [02]2653-5200#220
主旨
 PI-88期中分析補充說明
符合條款  第 51 款 事實發生日  103/07/29
說明
1.事實發生日:103/07/29
2.公司名稱:基亞生物科技股份有限公司
3.與公司關係[請輸入本公司或子公司]:本公司
4.相互持股比例:不適用
5.傳播媒體名稱:不適用
6.報導內容:不適用
7.發生緣由:
 基亞生技於7月27日進行PI-88第三期臨床試驗期中分析(interim analysis)。由獨立
 審議委員會針對PI-88第三期臨床試驗中首先復發的136個病例(約佔總分析病例數之
 60%)進行資料解密及分析。分析結果顯示主要療效指標「無疾病存活期」(DFS,
 Disease Free Survival)之差異尚未達統計上顯著。今年年底前,將由美國獨立影像
 判讀機構BioClinica完成確認病人電腦斷層及核磁共振影像資料,再提交獨立資料審
 議委員會審查討論,做為本臨床試驗療效的重要參考。

 本臨床試驗目前持續於25個臨床醫學中心執行,基亞預計最快於明年度(民國104年)
 進行218以上病例的期末分析(final analysis),確認PI-88在各項療效指標是否達到
 統計上顯著差異。

期中(interim)及期末(final)分析差異說明

 PI-88第三期臨床試驗療效指標包含(1)無疾病存活期DFS,(2)復發時間TTR,(3)腫瘤復
 發率TR,(4)總體生存期OS。期中分析主要針對主要療效指標「無疾病存活期」進行分
 析,期末分析則對上述全部療效指標驗證PI-88安全性及療效。

 期中分析及期末分析皆依統計學上雙尾檢定p值來檢驗治療組與對照組間差異的顯著
 性。當檢驗的p值越小,則代表差異越顯著,亦即療效越明顯。一般而言,當檢驗p值
 小於或等於0.05,就代表兩組在統計上有顯著的差異。依PI-88第三期臨床試驗設計
 ,期中分析僅分析60%的可分析病例,因此設定了高標準的p值(0.01806),用以檢定
 是否已達統計顯著性。期末分析對全部病例進行分析,療效差異之統計顯著標準則為
 p值0.04148。

8.因應措施:後續相關研發進度將於公開資訊觀測站公告發佈
9.其他應敘明事項:無。
2014年9月30日 星期二
Posted by Chih-Hao Chang

讀書心得 統計,改變了世界


非常令人驚艷的書,也介紹了很多統計名人,不過也是十幾年前出的...

老師如何評估學生的學習成效?
考試考幾次?只考一次夠嗎?  小考範圍要包含多久之前的?該每天考還是一週一次?

向平均數迴歸:
非常高的父母所生的孩子,往往比父母矮,非常矮的雙親所生的孩子往往比父母高。因如果沒有這種現象,經過幾代後就會出現一些非常高和非常矮的人

皮爾生的觀念革命:
科學就是量測,所有的實驗就某種意義來說都是草率的。所以可以把實驗結果看成許多散布的數字。科學的主體並不是那些可觀測的事物,而是描述與觀測有關機率的數學分布函數。

戈斯特先生:
啤酒廠在麥芽漿預備發酵的時候,要仔細測量酵母菌的量,但是酵母菌是活的會不斷的倍增,傳統方法是用顯微鏡計算酵母菌的數目,但酵母菌會複製,所以數量是變動的。戈斯特認為酵母菌的數目可以用卜瓦松分布來描述。

戈斯特想到期刊發表自己的成果,但吉尼斯公司不准員工對外發表文章,所以戈斯特以「學生」的名義在期刊上發表。戈斯特發現有平均數與標準差估計值的比值,就已經有一個可製表顯示的機率分布。這就是學生的t檢定!

費雪的作物收成變化研究:
目前很少有人敢聲稱自己明白天氣對農作物收成的影響。儘管這個問題對一個國家的經濟這麼重要,至今卻仍然搞不清楚,這可能一部分要歸啟於問題本身的太過複雜…而且缺乏定量數據,不管是學術界聝產業界,都沒有相關的實驗數據。

費雪提出了幾項準則,來評判哪些是好的統計的量
一致性(consistency)、不偏性(unbiasedness)、有效性(efficiency)

Fisher’s exact test
費雪利用顯著性檢定,產生了一個他稱為P值的 數字。假定五年後服用安慰劑的婦女有一半乳癌復發, 但服用新藥的完全沒有人復發, 這 樣能證明新藥有效嗎?

致命的劑量:
布利斯發明了一種他稱為機率單位分析(probit analysis)的方法,模型可以找出殺蟲劑的劑量與使用該劑量時一隻蟲子會死掉的機率兩者之間的關係。(LD-50)

假設檢定是一種正式的統計程序,是在「待檢驗的假設為真」的假設下,去計算觀測到的結果的機率。假設檢定是一種否定某個假設的工具。假設檢定的目的不是讓我們肯定某個假設,就算與該假設有關的機率非常大也不行。

為了檢定原始假設,必須有一組定義明確的對立假設。

尼曼的解:
尼曼在附錄中提出一種方法可求出區間估計值,並判斷所得的估計值有多準確。尼曼稱這個方法為信賴區間。而不用機率這兩個字。

對尼曼而言,與信賴區間有關的機率,並不是答對的機率,而是統計學家使用某種方法 經過長時間後做出正確 陳述的頻率。
Statistical formulae for calculating some 95% confidence intervals
如上公式可計算95%CI
95% CI = observed proportion ± 1.96 × SE
SE = sqrt [ p(1-p)/n]

柯莫格洛夫思考了機率計算的本質,最後終於發現找出一個事件的機率,就像找出一個不規則形狀的面積。在柯募格洛夫的機率理論公理化過程中,我們假設有這麼一個抽象空間。
假定統計分析顯示,新舊療法之間有明顯差異,那麼是否表示可以保證新治療法能治癒下一個病人。

p.169
南丁格爾也是自修成功的統計學家,發現英軍死亡的主要原因是在戰場外感染疾病、以及受傷後沒有得到好的照料而死,真正死在戰場上的人數並不多。她也使用圓形圖(pie chart)

無母數方法:
威爾考克森發現極端而不尋常的離群值(outlier),對計算結果的影響很大。怎麼知道哪個數字真的是離群值?要剔除多少個離群值才恰當?真的剔除了能不能繼續使用機率表?

曼恩與惠特尼得到一種檢定統計量,與威爾考克森的計算方式相同。在無母數程序發展出來後,產生兩個問題,如果數據本身有一個已知的參數分如常態分布,那麼用無母數的方法來分析情況會有多糟?什麼適合用無母數的統計方法來分析?

p.185
皮特曼發現只要數據偏離參數模型一點點,無母數檢定就遠遠比有參數的檢定更來得適合。
2014年7月22日 星期二
Posted by Chih-Hao Chang

總網頁瀏覽量

Blog Archive

技術提供:Blogger.

- Copyright © A hospice intensivist -Metrominimalist- Powered by Blogger - Designed by Johanes Djogan -