2015年1月26日 星期一

請教王文中老師之IRT相關問題

1. 樣本代表性 vs sample independence

IRT的特點之一為:模型估計出來的題目難度參數具sample independence。然而sample independence的特點是建立在「樣本具代表性,包括樣本數大,且能力分佈廣」的前提之下。
請問若樣本之能力分布較侷限(如能力極好、極差的樣本較少)的情況下,估計出來的題目難度參數是否能具有sample independence之特性?

實務上的例子:使用急性中風病人(動作能力通常較差)估計出來的動作題目參數,可否應用於慢性中風病人(動作能力通常因恢復或復健而變得較好)?

2. dependent samples 可否一起分析?對於參數估計或統計檢定是否會有影響?

Rasch model的assumptions中沒有sample independence,是否意味著我們可以把同一群病人在不同時間點的評量結果,合併成一筆資料進行unidimensional Rasch analysis?
(換句話說,同一位病人的評量結果可能重複出現在同一筆資料中多次)


王文中老師課後重點紀錄:

  1. infit & outfit 判斷標準訂定嚴苛或寬鬆,需考量工具之使用目的及重要性。如評估工具使用之目的影響深遠,如大學入學考試,則須採取嚴苛之標準。0.6~1.4仍屬於較寬鬆之標準。
  2. DIF和invariance意義大致相同,DIF為IRT研究者習慣用法;invariance則為SEM研究者習慣用法。然而二者仍有些微差異:DIF特別指題目在不同族群之難度是否有差異;invariance則不僅限於題目難度在不同族群的差異 (例如在不同族群是否有相同的factors)。
    此外,若有DIF或variance時,需進一步思考這樣的現象為什麼會產生,以及是否合理。
  3. measurement invariance處理方法:(1) 在有DIF的族群不評估該題目(但不同族群仍必須要有共同的題目!);(2) 看看有問題的題目跟其它題重複評估之結果是否有差異。例如其它題目都隨著評量次數增加而題目難度估計值越來越低,但有些題目則相反,這些相反的題目可能就有問題;(3) 如果全部測驗的題目不多,而測驗的使用目的又不是高風險,則還是可考慮保留該題目。
  4. Rasch analysis VS CFA
    Rasch analysis及CFA之理論、假設皆不相同,因此不宜也不需要直接比較!
    此外,
    CFA需假設variables的scale是正負無限大,這樣的假設難以符合真實情境。
  5. 多參數IRT模型的原始分數及thita不是一對一的對應關係,主要原因為:多參數模型有加權(如猜測度及鑑別度),因此原始分數不是thita估計的充分統計量!
    反之在單參數模型中,知道受測者能力 (b)就可以估計出thita,因此
    原始分數是thita估計的充分統計量!
  6. staging (分級)
    (1 )考量臨床上是否有分級的需求,例如分類個案的嚴重程度以進行不同的治療等。
    (2) 若要分級,則需要在題目設計以前就先決定分級時要分幾級,並設定各級的特性(如不能走路、不能站及臥床等)。接著再依據各級的特性,設定符合這些等級的題目及計分方式,以篩選出符合各個等級的受試者。
  7. sample independence VS sample representation
    使用有代表性的樣本估計出來的參數才具有sample independence的特性!因此找樣本時盡量廣泛的蒐集(如各地區、各年齡層等),且重複驗證在很多樣本後,發現參數的確都沒有太大的差異,此時才可做出sample independence的推論。
  8. 同一群個案不同時間點的資料是否可一起分析?
    若確保來自不同時間點的資料彼此獨立,學理上就可以一起分析,然而這些資料通常很難確保彼此獨立,例如練習效應、熟悉度、心理動機或疲勞等。
  9. Disordering
    影響:
    disordering表示有些分數點沒有發揮其功能,因此降低該題可以提供的訊息量。因此會影響題目的訊息量及信度(若合併disordering的題目信度會下降)。
    不影響:
    (1) 不影響Rasch model中Rasch score與原始分數一對一對應的特性,且原始分數越高,
    Rasch score也越高。
    (2) 不影響model fitting的結果。
    處理:可選擇不處理,因為在某一群樣本有disordering的現象不代表在其他族群也有,且處理後會降低訊息量!




2014年10月4日 星期六

第四十五次網球心得

之前很少練習打高於肩膀高度的球,因此每次遇到這種球就只能往空中抽球,導致對方也變得難以回擊。
這次網球課練習回擊約肩膀高度的球。回擊這種球的要領在於事先預測球的飛行軌跡及掉下來的高度。因為這樣的球通常飛行速度不快,所以有較充裕的時間移動。
準備擊球時,拉拍的高度需高於肩膀,揮拍時由後往前直線向前揮即可。
球拍與球接觸時須保持球拍面垂直於地面,否則球易掛網或飛出場外。

ICC值較不受樣本SD改變所影響,但SEM則易受到SD改變所影響!?

以下是模擬資料分析之結果:

ID T1 T2   10*T1 10*T2
1 -10 -20 -100 -200
2 -8 -16 -80 -160
3 -6 -12 -60 -120
4 -4 -8 -40 -80
5 -2 -4 -20 -40
6 0 0 0 0
7 2 4 20 40
8 4 8 40 80
9 6 12 60 120
10 8 16   80 160

Mean
-1 -2 -10 -20
SD 6.1 12.1 60.6 121.1

以T1, T2算出來之ICC值為0.8,與以10*T1, 10*T2算出來的ICC值相同!
因為計算ICC值時,其分子分母放大之倍數相同,最後達到之ICC值相同。
此結果意味著ICC值較不受到樣本SD改變之影響。

但以T1算出來之SEM值為4.9,而以10*T1算出來的SEM值為48.8,
二者相差10倍!由於10*T1, 10*T2之SD分別為T1, T2之SD的10倍。
此結果意味著SEM值會受到樣本SD改變之影響。




2014年9月24日 星期三

評估工具之適用性(feasibility)評判之向度分歧且缺乏評判之標準

MeSH TERM對於適用性研究 (feasibility studies )之定義為:「探索【優缺點】、【可行性 ( practicability)】、或【研究/研究計畫可被完成程度】等相關之研究」。

評估工具之適用性則代表評估工具施測之優缺點或可行性。

然而目前研究上對於「評估工具之適用性」該依據哪些向度評量(如評估所需時間、題目可讀性等)莫衷一是,甚至常常南轅北轍。
至於各個「評估工具之適用性」評量向度的評判標準更是少見...

這將造成臨床及研究人員難以評判評估工具之適用性好壞,進而無法選擇最適用於其環境或需求之評估工具。

也許可以進行「評估工具之適用性」相關研究,已建立評判評估工具之適用性之framework!
如搜集施測者及施測者使用不同型式之測驗(問卷或操作型)時,其認為哪些向度是重要的「評估工具之適用性」評析向度,並調查其認為可接受之標準。
甚至依據調查之結果編制一「評估工具之適用性」之評估工具。

2014年9月19日 星期五

第四十三 & 四十四次網球心得

這二次課程的重點分別為截擊及底線抽球。

上次雙打比賽時常無法掌握截擊的站位;以及無法精準地判斷截擊時機,有些球應該是截擊者要截擊的球卻放掉...因此教練針對這二個較弱的環節加強練習。
此外還學了一項新的技巧:截擊反手高球。須以forearm supination的方式將球壓下,使球以類似殺球的方式直墜入球場。

底線抽球雖然教練常教,但每次練習還是有不同的體會跟收穫。隨著對於正手抽球的動作越來越熟悉,教練要求我們抽球的目標逐漸由"全力抽球"變成"控制球的過網高度及落點"。需特別注意的是,有時候為了控球反而導致揮拍動作做得不完整,但這反而會造成控球更糟的惡性循環!

2014年9月8日 星期一

暑假任務及旅遊行程

類別
內容
目前進展
學術任務
黃老師-常用於中風病人之工作記憶力評估工具回顧
已完成方法及結果
CAAT & CPDT收案 @亞東醫院
已開始約個案/評估
C-DVT論文
已進入第二次審查
FDT論文
已進入審查 (Disabil Rehabil)
CAAT指導語修改
已請明昆協助修改
出遊
暑假旅遊
9/9 (二)~9/12 (五)

2014年9月2日 星期二

CAAT修改方向

練習題流程修正

  1. 每講解完一種操作規則後立即進入該部分之練習題。如:說明/示範「看到塗黑色的圖案要判斷圖案是不是正方形」之後,進入塗黑色圖案的練習提。再說明/示範「看到沒塗色的圖案要判斷大的跟小的形狀是否一樣」之後,進入沒塗色圖案的練習題。
  2. 當受測者在練習題中答錯時,給予更明確的錯誤提示(如:您作答的方式和規則不太一樣)。接著再給予該部分練習題的規則說明。
  3. 當第三個部份的練習題(塗黑色跟沒塗色二種圖案交替出現)結束後,進行模擬測驗。如此一來可改善現在第三部分練習題題目太多的問題。在模擬測驗中不會提示受測者答對或答錯。
  4. 模擬測驗結束後,給予休息20秒。休息結束後給予受測者選擇進入正式測驗或再聽一次規則。若受測者選擇再聽一次規則,則重第三部分練習題開始重新說明規則。

指導語說明
  1. 說明文字比較多的畫面,增加「打開語音」的設定(類似CPDT的設計)。預設的情況下,文字較多的畫面部出現語音說明,以免影響閱讀。
    但操作示範仍會自動撥放語音。
  2. 在講解規則時,先不要讓操作示範的手出現,等要示範動畫開始時再讓手出現,減少不必要的訊息。
  3. 「一不一樣」的字樣皆改為「是否一樣」。

感謝沛綺幫忙進行CAAT修改建議的認知訪談及意見彙整!
期待再版的CAAT可以讓受測者更快更直覺地瞭解規則,以期達到受測者無須協助即可自行完成測驗。