2011年9月26日 星期一

測驗編製步驟(1)及其對應的教育與心理測驗標準

1.測驗編製計畫

標準1.1
應該呈現對於測驗分數的每一建議的解釋和用途的理論根據,並且附上該用法或解釋的證據和理論的綜合性摘要。

說明:理論根據應指明研究所建議解釋需要什麼樣的前提條件。
綜述應結合邏輯分析和實證證據對測驗的理論提出證據。
證據可取自測驗將要使用的情境的區域性的研究;也可取自前人的研究;或取自現有的研究結果的全面統計綜合,而這些結果已明顯達到效標。

沒有一種類型的證據天生就比別的證據更可取,而是證據的品質和它對預期用途的關連性決定了該種證據的價值。
對任何一點的實證證據的敘述在科學文獻理應對所有的有關發現都給予應有的份量,甚至包括和預期解釋或用途不一致的結果。

測驗編製者有責任對自己提出的建議提出支持性的證據,但測驗使用者有責任評鑑所提供的效度證據的品質,和它與本地情況的關連性。

標準 3.2
測驗目的(purposes)、內容領域(domain)的定義、和測驗規格明細表(specifications)應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。

說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。

內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,而哪些是被排除的。

清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。

標準 3.9
當測驗編製者在評鑑試題的心理計量特性時,應以書面說明其使用的是古典理論模式或是試題反應理論模式(IRT)。對於用來作試題分析的樣本應有詳盡的描述,而且樣本的大小和多樣性應該與試題分析方法相配合。
選題的過程和用來作選題的數據資料(如試題難易度、試題鑑別度和(或)試題訊息度等),也都應作成書面說明。
若是用試題反應理論模式來估計編製中測驗的試題參數的話,那試題反應模式、估算步驟、以及模式的適配性(model fit)的證據,都應該做成書面說明。

說明: 雖然整個樣本的大小很重要,但在對於試題的心理計量上特性有決定作用的地區,抽取恰當數量的樣本也同樣重要。如果這個測驗期望在分數軸上的特定區域達到最精確的估算值,且這種考慮影響到試題的選擇時,試題統計參數使用的方法需要仔細說明。

當以試題反應理論(IRT)作為測驗編製的理論基礎時,要記錄下採用的模式和數據資料間的適配程度的數值就非常重要。這一點可以通過檢查試題反應理論的假設條件的滿足程度來完成(比如﹕單維性、試題局部獨立性、或試題斜率參數)。

測驗編製者應該證明,試用版測驗和正式測驗的實施條件之間如有任何差異都不應影響試題發揮。

會影響試題統計參數的條件包括:試題在測驗中的位置、測驗時間限制、測驗題數、測驗方式(如:紙筆測驗還是電腦輔助性的測驗)、計算器或其他工具的使用。例如,在檢驗試題時,把某一試題放在試卷末尾時所得到的統計參數,就可能會比把它放在試卷中間時還要差。

測驗編製步驟(2)及其對應的教育與心理測驗標準

2. 界定試題內容取樣範圍

標準1.6
當以測驗內容的適當性作為效度驗證(validation)的一部分時,應該測驗所測量的構念或所代表的學科領域,對於確定和編寫測驗內容的步驟加以說明並提出充分理由
如果界定的內容是結合重要性、出現頻率、或關鍵性等規準(criteria)來抽樣時,也應該對這些規準作出清楚的解釋並提出充分理由。

說明:例如,測驗編製者可能提供一個邏輯架構,排列出試題在學科領域的分佈,表明每道題目的相關性,和整套題目及與之代表的學科領域的符合性。學科領域裡沒有包括在測驗裡的部分最好也加以說明。

標準 3.2
測驗目的、內容領域的定義、和測驗內容細則應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。

說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。

內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,哪些又不包括在測驗內。清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。

標準 3.11
測驗編製者應將測驗內容所代表的領域和測驗規格明細表都作成書面說明,以利於作出有效的分數解釋。

說明:測驗編製者必須提供試題和評分規程代表限定內容領域的程度的證據,這樣有助於確定測驗分數是否能夠概推到所評量的內容領域。這一點對於只有少量試題的實作評量特別重要。這類證據可經由專家仲裁來提供

標準 14.8
基於測驗內容的效度證據要求對於有關的內容領域有透徹和清晰的界定。
對於用於選拔、分類和晉陞的測驗,對內容領域的特徵描述需要根據工作分析(job analysis)。

說明:一般說來,應該根據工作任務、工作人員的知識、技能、能力和其他人格特徵等方面來描述工作內容領域。這些特點應該具有清晰的量化定義,以便與測驗內容相連接。同時,這些工作要求在一段時間內不會出現明顯的變化。
這些包括在內容領域裡的知識、技能、和能力,也應該是那些工作應徵者在被僱用時應該擁有的。

測驗編製步驟(3)及其對應的教育與心理測驗標準

3. 編寫測驗規格明細表

標準 3.3
測驗規格明細表(test specification)及其研發的理論依據和過程應該作成書面說明。
測驗規格明細表應對測驗內容、建議的試題數目、題型、試題的心理計量特性上的要求、以及各部分試題的安排等作出界定。
測驗規格明細表中還需要說明測驗的時間限制、對受測者的指示、施測和評分的步驟,以及其他有關事項。

說明:專業判斷在測驗規格明細表的製訂中扮演重要角色。
製訂規格明細表的具體步驟要根據測驗目的而定。
例如,在編製授與執照或證書的測驗時,對實際開業人員知識能力的分析和工作內容的分析,常為界定測驗規格明細表的範圍提供了實務的基礎。
而工作內容分析也為僱用測驗提供了基礎。
對於一門課結束時的學業成就測驗而言,測驗的規格明細表須要以課程內容大綱和教學目標為準。
但對安置測驗(placement test)來說,可能有必要審視好幾門課程在起步時所需要的知識和技能。

標準 3.4
解釋測驗分數的程序必須作成書面說明。合適時,建立常模的或標準化的樣本,以及所使用的效標的詳細說明也須作成書面說明。

說明:測驗規格明細表可以註明測驗分數的解釋是相對的還是絕對的,或是兩者兼而有之。

在相對分數解釋(常模參照式測驗)情形下,一個人(或一群人)的位置是由這個人的分數(或次群體的平均分數)相對於他所比較的一個或多個事先劃定的次群體而定的。

在絕對分數解釋(標準參照式測驗)情況下,分數(或平均數)被認為是直接反映受測者(或受測者次群體)在某個已經定義的效標領域的能力或精熟水準。

針對一種解釋而設計的測驗,對於另一種解釋,可能效果不是那麼好。但是,如果試題選擇完全吻合領域的界定,且如果可以衍生出一無可非議的標線標準的話,常模參照測驗裡得出的分數,也有可能做出有效的絕對分數解釋。

反之亦然,標準參照測驗裡產生的絕對分數也可能做出合理的相對分數解釋。但是設計來測量某一水準的精熟測驗(Mastery Tests),可能無法提供足夠的變異性來讓這些受測者做出正確且精細的排序,因此難以建立合理的常模。

2011年8月11日 星期四

社會計量技術

社會計量技術

社會計量(sociometric)技術是一種用來觀察、測量、和改變社會互動的方法,其主要探討目標是一個指定的社會系統中的各種角色關係和功能,而要改變人的行為是要在這系統中重新建構其角色和功能。社會計量法假定在結構與功能之間有直接關係。

因此強調每個人所知覺的地位、作了什麼、以及人們對它覺得怎樣。它的目標是要揭露重複互相作了什麼,是由誰、對誰、以及如何,而且還要揭露這行動的目的、意義、和影響。由於焦點是放在重複的行為模式,行為是任何科學中可觀察、可測量、和可預測的主要元素。
 
社會計量法可以被看做是一種技術或一種測量方法。為了達到能夠被用來繪製圖表和鑑別的層次,社會計量法必須要符合科學家對於測量工具的要求:例如獨立觀察者之間的一致性、內部一致性、相似性(指如果沒有經過治療處理,在可見的未來會發生同樣的結果)以及對於反映出的家庭關係賦予意義時的區辨力。

當社會計量法被用來改變社會互動時,它就成為一種技術。社會計量技術之所以非常適用於夫妻和家族治療中,是因為它們在描述每一個人在系統中的地位、成員的互動形式、和他們對它的感覺上,是生動且很有效率的。

在歷史上,摩瑞諾(Moreno)和其追隨者曾引進社會計量技術給心理健康臨床醫師,特別是許多和心理劇(psychodrama)、社會劇(sociodrama)和雕塑(sculpting)有關的技術。在他們之後,社會心理學家和臨床醫師也引進了許多新技術,下面是一些例子:

  1. 社會關係圖(Sociogram)----一種將角色關係中的偏好和選擇繪製成圖表的方法。
  2. 家族關係圖(Genogram) ----一種將家族成員的關係和順序繪製成圖表的方法。
  3. 生態地圖(Ecomap) ---- 一種將這一家庭在大家族和社區中的地位、運作於它的影響力、和可用的資源都繪製成圖表的方法。
  4. 家庭平面圖(Family Floor Plan) -----一種將空間、地方、和情緒繪製成圖表的方法。
  5. 雕塑技巧(Sculpting) ----一種擺佈各個成員的身體,以用來表現出他們在一特定情境或理想上的關係的方法。
  6. 遊戲(Games)----藉著用積木建造塔或房子,或藉著完成智力競賽性遊戲或解決問題,來把象徵性地把角色行為付之行動。
  7. 角色卡遊戲(Role Card Game)----用來確認個人在家庭中所察覺的和期待的角色。

不同理論學派的擁護者使用社會計量法來獲得資料和與他們的理論一致的結果。

舉例來說,心理分析學家會獲得一些對於被認定的病人的影響力的資料,如: 社會影響、投射和認同模式、未完成事件或在原生家庭的心理創傷、挫折的昇華、因應與適應機轉、和對潛意識行為的線索。

溝通理論學家會找出溝通的路線和這系統內錯誤的溝通。他們的興趣在於決定誰是溝通的中心,以及誰是明星、孤立者、阻礙者、支持者、質問者、追隨者等等。

系統理論學家關心這一互動系統的模式和形成;它在權力和決策、界線、親近與疏遠、同盟、共謀、角色、規則、互補、與類似這些方面是如何被組織起來的。

治療師可以把這訊息回饋給案主以增加他們的覺察和頓悟。她可以經由直接行動、訓練、發問、解釋、或直接的指示來介入或重新塑造這一個建構。

社會計量法能提供許多好處:

1. 它們把治療從理智的或情緒的討論轉移到實驗性的具體行動。
 這會增加每一成員的主動參與, 而它通常會對增加案主的自發性,和減少因智力競賽所引的抗拒有效果。

2. 它們把過去、現在、和預期的未來放進一個此時此地運作的架構。 
我們可以回憶,但我們不能改變過去。我們可以期望,但我們不能活在未來。藉著把這些放在一個此時此地的經驗中,案主可以立即採取行動來改變知覺、理解、計畫或行為。

3. 它們包含了個人認同和投射的重要元素。 
各種信仰、感覺、和態度在互動的脈絡中以行為表達出來,這樣它們成為外顯的和可用來檢驗和修改的。投射對於適時的描繪加入一性質上的轉向。(參見第二章序論,可知投射的優點和性質)

4. 它們把各種角色和角色知覺加以揭露和戲劇化。
 成員們觀察每一角色在作什麼,它是如何被知覺的以及這角色是如何被增強的。

5. 它們與案主對於治療的期待有令人訝異的差異。
它們可能有助於避免可能遇到的抗拒。

6. 它們是有趣的。 
這些技術可抓住案主的注意力。

7. 它們構成一種後設溝通(meta communication)的形式。
 現實和神話被合併在一起而新的訊息,而新的訊息被系統的闡述;發送、和接收。舉例來說,當一個家庭被雕塑,而父親是被放在家庭的圓圈外面,背向著家庭,這個事件對丈夫、妻子、孩子、和整個家庭都透露了多有用的訊息。

8. 它們把注意力集中在社會單位和社會互動歷程。 
當這家庭注意到他們的相互的行為和地位時,「病人」或被認為的案主的孤立和疏離的感覺也會被質疑。很清楚地,一個人是不可能領導的,若另外一個無法追隨;一個人不可能如此無助並存活下來,如果另一個人不接管並為他做事。這類因素如親密、各憋性、親近、疏遠的調節、和衝突管理技巧都被注意到。

2011年5月3日 星期二

問卷調查時,如何篩選亂作答的樣本

在編製測量工具時,我們可以進行試題分析以篩選出符合需要的題目。但是在將資料進行試題分析之前,我們也常發現有些受測者胡亂填答問卷或量表。

基於資料分析上「垃圾進就會垃圾出」的基本定理。我們在施測時的預防受測者亂答,以及在施測之後辨識與清理垃圾資料,是確保研究品質的必要步驟。

如何在施測前或施測時預防受測者亂答

1. 擬題及審題時,提高文字可讀性(字彙簡單、句型結構短),減少受測者閱讀上的挫折感
2. 量表要講究印刷與裝訂,以提高其表面效度
3. 由研究者親自施測,以控制氣氛及情境
4. 向受測者強調此研究的重要性,並感謝他們奉獻時間
5. 提供受測者小禮品,以提高作答動機

施測後如何辨識出亂答的問卷


要找出亂作答,致使問卷無效的樣本,最好先研究MMPI的效度量尺,瞭解各種效度量尺所依據的原理,我們也可以依樣畫葫蘆,很快找出無效的樣本。

1.以目視檢查問卷是否有明顯亂答情形(勾不到正確位置、筆跡草率、有固定循環模式)
2.檢查空白、漏答的數量(空白數量太多表示作答者有閱讀理解困難,空白集中在問卷後半段表示作答意願不高,後面亂答可能性很高)
3.以統計方法偵測出亂答的受測者(用SPSS的COUNT點數個案在所有試題上的作答反應,檢查是否有明顯反應心向,例如,90%以上的題目答5)

偵測胡亂答的受測者時所用的基本假定


1.個人在各選項上的選擇次數差距應該不大,除非嚴重受反應心向所影響。
當一個人的整份態度量表都連續十幾題都填在同一位置,例如都填3,我們可以假定他已經填得不耐煩,亂填應付了事。這種現象通常在很長的量表的後半部出現。

2.個人對於相同或極類似的兩個題目,應會有相同的反應(比如,測謊題)。
有些量表編製者會把完全相同,或幾乎相同的兩個題目,分別放在量表的前端和後端,量表回收後,就先比較該兩題的作答反應,若差距太大(在五點量表中,兩題差距等於或大於3),即可以懷疑作答者是胡亂作答。

3.眾人在某些特定題目上會有極類似的反應(比如,社會期望值特別高的題目)。
某些題目會因為其敘述方式或題目內容,而導致大多數人對該題的反應非常一致,此時若某人的反應與眾人背道而馳,你也可以懷疑他有亂答的傾向。

建立信度、效度?

近年來常常在研究生論文中看到「建立信度、效度」這一用語,常覺得好笑。真不知道要說這是因為觀念錯誤而導致用詞不當,還是因為人云亦云,不加思辨,而導致觀念錯誤?

我們可以說:「編擬」、「建構」、或「發展」一個測驗,因為該測驗是無中生有,一點一滴逐步建立起來。但是「信度」是編好測驗之後,研究者想要知道它使用在某一類對象上間隔不同時間時的前後一致性(重測信度),或是它用於多人主觀評分時的評分者間一致性 (評分者間一致性),或者是所測特質的純度(內部一致性),因此信度研究是指用不同方法從不同角度檢驗它不受外來因素干擾,免於隨機誤差的程度。

簡單地說,信度是依附著特定測驗的內容及施測程序而存在,是無從憑空建立起的。

效度則是指該測驗施測於某種對象,並以其結果做某種決策時的有效程度。所以一個測驗有多少種用途,就會有多少種效度研究。

我們會請專家審查該測驗的構念分析、規格明細表、及試題內容三者的邏輯性及適切性(驗證該測驗的內容效度、邏輯效度);或者找到最有代表性的外在效標與測驗 分數求相關,以證明它真能測到所要測的特質(驗證該測驗的效標關連效度);或者是以因素分析、假設考驗等方法驗證測驗分數結構與當初編製測驗的構念相吻合 的程度(驗證該測驗的構念效度)。

所以效度也只是在測驗編製好之後,在正式大規模使用之前的性能驗證工作,它無從建立起。

至於 Cross Validation 一詞,最好翻譯成「交互驗證」,它是指測驗編好之後,編製者常以建立常模的樣本進行效度研究,因此其結果常被質疑沒有可類推性。而交互驗證則是由不同的研究者以不同的樣本驗證此一測驗的效度,若是換了研究者、換了樣本,測驗結果在使用上仍然有效,那麼這測驗才是真的有效。

如何回答申論題

最近去改考卷,有一千多份的申論題試卷,熬了將近十天才全部改完。改完之後,覺得感慨良多,因為有些考卷看了第一眼之後,還沒開始讀,就知道它的分數的可能落點了。

我想當考生的人也應該學一些回答申論題的基本常識吧,至少要使得自己的試卷看起來還有些表面效度,讓閱卷者願意花時間去讀它吧。 以下是一個閱卷者給考生在回答申論題時的一些建議:

別省紙張,每一大題另起一頁


當你拿到試卷與答案紙時,先看看試卷上有多少題目,粗略地估計回答每一題所需要用的篇幅,再看看答案紙,看你有多少空間可以利用(通常每一大題平均有兩頁 的空間),立刻分配各題所需的空間,並在頁面左上角依順序標上題號。然後你就可以從最有把握的題目開始寫了。 瞭解你所面臨的問題,評估你可用的時間和資源,然後規劃時間和資源的應用方式,這是一種行政人員所必備的做計畫才能。

若你一開始就能夠展現這樣的才能,你 的試卷看起來就不會雜亂無章,閱卷者也比較願意多花精神仔細讀你的文章,當你的文章內容與他人是在伯仲之間,他也比較願意相信你是比較有能力的,因為你已 經在答案紙上展現了你解決問題時的規劃能力。 也許有人會擔心,如果某一大題留了兩頁的空間,結果只寫了一頁,閱卷者會不會以為後面全部是空白,而漏看後面的題目?不過你放心,閱卷者通常不只一人,而 且後面還有複核和登分的人會看到你的試卷,從來沒有人的試卷是明明有答案卻沒被批閱的。

標示題號,小標題之間要空行


閱卷者通常會把分數寫在你的題號的下面。但若在一大題之下,又分成數個小題並標示各小題所佔的分數,哪你就要依順序標上各小題的題號,並在小題與小題之間留有空行,讓閱卷者一目瞭然,千萬不要整個大題不分行也不分段,密密麻麻寫成一個實心方塊,讓閱卷者找不到頭緒,而愈找愈火大。

漂亮清晰的版面會讓閱卷者相信你是腦經清楚,做事有條理的人,即使專業知識有些不如人,也是可以諒解和補救的。

體恤長者,字要寫得又黑又大


一般而言,閱卷者平均年齡都在五十歲以上,大部分人已經開始有老花眼了,他們最怕看那些又細顏色又淡的文字,若加上字體又小的話,那對他們而言,就是一種折磨。

所以請你使用比較粗一點的黑色筆來寫,字的底部要緊靠著格線,字的高度約佔格線高度的三分之二,千萬別小於二分之一。 若你現在就能體恤閱卷的大伯大嬸,他們就會相信你將來當了官也會苦民所苦,而給你較多的機會上榜。

依序寫題,遵循指令大家方便


在答案紙上,考生若不按照題號順序來寫,當然閱卷者仍然會前翻後翻地找到你的答案,然後給你分數;因為從來沒有人在試卷上明文規定,說你不按順序排列答案要扣幾分。 但是當閱卷者在翻找你的答案時,他一定心裡會想,答案紙上「依序作答,標上題號」這麼簡單的指令都無法確實遵守,這個人將來如何指揮,如何與他相處?無形中,你在閱卷者心中的評價又掉了好幾級。

依據我個人的觀察,答案不按照題號順序排列的人,通常也不會將每一大題另起一頁,而各小題之間也不會留有空行,以示區隔。他就是要隨心所欲,想到什麼就寫什麼,他的試卷雜亂無緒,常讓閱卷者氣憤頭痛。

看清題意,千萬不要自問自答


曾經改到一篇洋洋灑灑些了三頁,簡直就是精煉過的課文摘要,不過我還是給了他零分,因為他實在是答非所問,我總不能因為他的內容跟題目中的某一名詞有所關聯就給他墨水分數。 我想這也許是補習班教的招數,補習班抓題目並準備答案讓考生背,若沒抓到題目,只要題目跟他所背的內容有一些關連,他就整個硬套上去,而不管題目實際問的是什麼。

當然,另一種可能性就是張冠李戴,例如: 測驗與統計合成一科考試時,考解釋名詞就有人把 T score 和 t-test 搞混淆了,或者把「測量標準誤」、「平均數的標準誤」、「估計標準誤」都混在一起了。

有話直說,前言結語畫蛇添足


有些人寫申論題就好像寫碩士論文,要在每一章的前面加上前言,在尾端加上結語(很可能是補習班教的)。前言通常寫的是相關概念的名詞解釋,結語寫的是相關概念的重要性。 但實際在閱卷時,常看到閱卷老師瞄了答案一眼之後,立即紅筆一揮,把前段和後段各畫了一大叉叉,然後才開始點閱中間的部分。

可想而知,加了前言與後語,只是在浪費時間與墨水,並不會為你加分,說不定閱卷老師心裡頭也在咒罵,你何苦浪費自己時間,也浪費別人時間。 

以上這些建議都與你要考的專業知能無關,但是你在"解決問題時的規劃能力","設身處地為他人著想的思考習慣(同理心)",也都是擔任行政官員應該具備的能力。在考申論題時,這兩種能力在就在有形無形中,加進到你的分數去了。 

因此,就傳統效度的觀點來說,閱卷者的分數把其他能力也參雜到專業科目裡去了,包含非所要測能力的結果,會使內容效度降低。

但從另一角度來看,面對難題時的了解可用資源並規劃執行的能力,以及做事時設身處地為他人著想的能力,都是擔任公職者所需要,而考試科目中卻沒有考到的,因此,把這因素加到測驗分數中,更能涵蓋應該測量的多種能力,這會使得考試分數與未來實際工作表現的相關更高,也就是預測效度更高。