2016年10月4日 星期二

測驗的版面設計與印製

A. 試卷版面設計應注意事項

完整的試卷應該包含三大部份:封面或卷頭、題型與作答說明、和試題內容。進行版面設計的目的在於使試卷更美觀、更容易閱讀與作答,及更方便計分。

1. 封面或卷頭部份

標準化測驗題本的封面上通常包含有測驗名稱、編製者、出版單位及出版日期等內容,左上角常留有編號的位置,以便於題本編號後好清點保管;右上角常印有「限閱」兩字,以提醒相關人員測驗的內容需要保密。
至於學校考試卷的卷頭要包含有學校全銜、學年度、年級、學期、學科名稱、評量性質、以及學生填寫班級、座號、姓名的位置。試卷橫寫時,卷頭放在最上面;直寫時放在最右邊。
卷頭的字型最好與試題有所不同,且其字體大小要明顯大於試題內容。卷頭部份若若有足夠空間,應該在學生姓名附近留出空位供教師填寫總分之用,如此登記分數時較為方便。

2. 題型與作答說明部份

標準化測驗通常只用一種題型--「選擇題」,即使有不同題型也都以分測驗的形式加以區隔開來,因此其作答說明就是各分測驗的「指導語」,它通常單獨佔一頁,而且是印在單數頁(右頁),正式題目則印在指導語的背面,如此可防止學生趁著主試者在唸指導語時看到正式題目。
編寫學校試卷時,各種題型的作答說明要放在該題型的前面,並且採用不同字型以示區別。若是學生已經很熟悉的題型可以只寫出題型名稱,省略掉答說明部份。作答說明之後通常會註明該題型的配分比例。

3. 試題內容部份

至於試題內容部份的版面設計則應該注意下面幾點:

1. 字型、字體大小的選擇

字型、字體的大小和字距、行距都要配合學生年齡以便於閱讀。字型(typeface)的選擇應配合學生現在用的教科書,以比較常見的明體、宋體、仿宋體為主,隨意使用較少見的字型(如隸書、行書),可能降低學生的閱讀速度,甚至使國小學生無法辨認。英文字字型則最好選用Helvetical, Palatino, Times Roman 中的一種。
大部份文書處理程式還可以進一步把原來的正體(normal)字型變化出不同風格(style),例如:斜體(Italics)粗體(bold)加底線(underline) 。「正體」適用於一般文字敘述上,使用機會最多;「斜體字」常用於特殊名詞,如:書籍、期刊、樂曲、影劇、詩詞等的名稱上;「粗體字」可以用來區別作答說明和試題;至於「加底線」可以用來強調題幹中所要強調的字眼,例如:不是、不應該、最沒有效等等否定性的字眼。若有必要還可以把後三種加以組合,例如:斜粗體斜體加底線粗體加底線斜粗體加底線
當文書處理程式是以點數(points)表示字體大小時,一英吋有72點,且允許你以一點一點的調整字體大小。一般常用的是12點,但若是大學生或成人,10點也可以,至於國小低年級則最好用14點。

2. 字距、行距與段距的選擇

字距(兩個字之間的距離)縮小時,每一行就可以排入更多的字,但字距太小時,版面會較「暗」,且不容易閱讀。
行距(一行行之間的距離)的調整應該是使行距大於字距,這樣才能引導眼睛的移動方向,閱讀才能順暢,文書系統預設的行距大多是依據字體大小再加上字體大小的20%左右。
段距(各個段落之間的距離)要比行距還大才可以使試題與試題之間有適當的間格,使每一題自成一個單位,讓讀者一目了然。

3. 試卷上下左右邊緣應保留24公分的空白

試卷版面上下應該留有空白,俗稱「天地」,習慣上留邊時是天多地少,這樣可以讓教師在上方登記分數或書寫評語。上下左右留邊除了可以增加美觀外,並可以避免在印刷時把文字內容印到紙張之外,此外,也比較便於裝訂和保存。

4. 有時候版面可以分成兩欄以節省空間並便於閱讀

試卷若像報紙、雜誌一樣採取多欄式的版面設計,可以減少眼睛移動距離,加快閱讀速度。當選擇題的選項都很短時,排成兩欄可以節省空間,容納較多的題目。多欄式的排版需要用到具有排版功能的電腦文書處理軟體,若用一般的打字機處理常事倍功半;關於微電腦在測驗編製上的應用,在第十五章會有更詳細的介紹。至於分成幾欄,則因紙張大小的限制,以兩欄較為恰當,兩欄以上並不實際。

5. 選擇題的各個選項要有適當間格並做規則性排列

選擇題的選項的排列原則包括:不把單一選項拆成兩行、選項的標號要上下對齊、不同試題之間選項排列的格式要力求一致(請比較例題1的各種排列方式)。選項若是數字,應該把個位數及小數點上下對齊(例題2
例題1
(  )1. Mind you own business.
這句話的最佳翻譯是:(不規則排列)
       A.
要多照顧自己     B.少管閒事     C.小心照顧你的
       
事業    D.要記住你自己的事業
(  )2. Mind you own business.這句話的最佳翻譯是:(缺少間格)
     A.
要多照顧自己B.少管閒事C.小心照顧你的事業D.要記住你自己的事業。
(  )3. Mind you own business.這句話的最佳翻譯是:(佳)
         A.
要多照顧自己    B.小心照顧你的事業
         C.
少管閒事            D.要記住你自己的事業

例題2 (小數點應上下對齊)
(   )1.  6.081
×10 = ?
          A.         .006081
          B.         .06081
          C.     60.81
          D. 6081

6. 題號要採用凸排,並和試題內容相隔開

在段落格式上要使每一試題的第一行凸排,讓作答位置與題號都突出於題幹與選項之外(如例題136),如此可以方便學生迅速找到所要的題目。題號與題幹之間要以句點或空格隔開,尤其在數學科中,題幹一開頭就是數字時(如例題137)更需如此,必要時還可以變換題號的字型以示區別。

7. 做答位置應有固定大小並作規則排列,以便於閱卷和計分

直接在試卷上作答時,應該把是非題、選擇題和配合題的作答位置放在試題編號的左邊(橫排時)或上面(直排時);而填充題也應該採用固定大小的作答位置並把它移到題號前面。作答位置集中在一邊,且緊接著題號,不但便於計分,也方便考試後的檢討。國小學生手眼協調能力有限,應給予較大的書寫空間,以免增加作答及計分時的困難。

8. 若採分開使用的答案紙應該每隔數題就留有適當的間隔

標準化測驗常使用分開的答案紙以節省紙張成本,這時答案紙的設計最好依照題本上每一欄的題數,每隔數題即空出一題的大小,如此可以方便學生找到正確做答位置。

9. 整份測驗應該把所有試題不分題型連續編號

雖然有許多人已經習慣於把每一種題型都重新編號,但是連續編號不但讓教師和學生便於共同檢討試題內容,當要將原始答案輸入電腦進行資料分析時,也比較容易鍵入和校對資料。此外,若是採用分開的答案紙作答,連續編號更是不可少。

10. 試題要保持其形式上的完整,不可以拆成兩半,而降低其可讀性

排版上有所謂的「孤兒」和「寡婦」。孤兒是指文章需要分欄或分頁時,被單獨遺留在文字欄頂端的一行不成句子的字;寡婦則是指被單獨遺留在段落或文字欄底端的一個字或音節。遇有孤兒和寡婦時,應把文字稍加增減,以消除這種現象。
有些文書處理系統上有所謂的「避頭尾字元」的功能,它可以避免你把前置的標點符號,如:「、『、(、《等放到一行的最底端;也避免把尾隨的標點符號如:。、!、?、》、)、』、」等放到另一行的最上端,使用這種功能也能增加試題或文章的可讀性。
當試題的一部份跑到另一欄或另一頁時,常會造成學生的困惑,閱讀上也很不方便。就整個版面來看會顯得雜亂,而讓閱讀者心煩氣躁,要避免此種現象,應在應在段落樣式中設定為「段落中不分頁」。
當學生需要閱讀某些資料才能作答時(如閱讀理解測驗),應該把這些資料和試題放在同一頁上或同一面的相鄰兩頁(閱讀資料放在左頁或偶數頁,試題放在右頁或奇數頁),千萬不要把試題放到閱讀資料的背面去,讓學生答題時還得不斷地翻頁。

11. 標準化測驗的指導語和試題不可以放在同一面或同一頁上

有時間限制的測驗應該把試題要放在指導語那頁的背面,或是以空白頁將指導語和試題隔開,這樣才可以避免學生在主試者宣讀指導語時就順便偷看試題。

B. 檢查及印製

雖然測驗的檢查與印製過程與測驗編製的專業知能無關,但一份錯字連篇、印刷不清的測驗,顯然不會有內容效度的,當然也不可能得到使用者的信任。

1. 付印之前應該經過校對程序

每個人在以目視的方式校對自己的文章時,常會不自覺地在心裡補回漏字或忽略錯字,所以才需要大聲唸出來或是請別人校對。另外,最好找幾位不同的人來逐題作答,這樣做不只是比較容易找出贅字、漏字及錯別字,也比較容易發現在題意或標準答案上有疑義的題目。

2. 應該依保存年限、作答方式及數量來選擇紙張及印刷方式

紙張的厚薄及品質對於印刷效果和書寫方便性影響很大,在選用前應該事先試用和比較,學校一般多採用印書紙或模造紙。印刷試卷時,若數量少則以影印較為快速,數量多時以製版印刷較為經濟。

3. 試題所附的圖表在印刷前和印刷後要檢查是否正確和清晰

試卷上的圖表通常是剪貼上去的,所以要特別注意它是否放錯位置、貼顛倒、有折痕、或甚至脫落了。此外,要應先試印幾張,確定圖表的細節都足夠清晰後才可以繼續印下去。

4. 單張雙面印的自編試卷應該逐張檢查是否有漏印或相互污染情形

在進行印刷時常因紙張之間的靜電反應而使紙張相互吸附在一起,造成漏印的情形。而室內溫度、濕度、油墨濃淡都會影響油墨乾燥的快慢,所以印刷時要隨時檢查,以免試卷相互汙染。

5. 若要裝訂成冊,最好在排版時就使頁數(含封面和封底)成為四的倍數後,採騎馬訂方式裝訂

由於標準化測驗題本的頁數不會很多,裝訂時可以採用騎馬釘,亦即由封面和封底的齊縫處打釘,貫穿到最中間的齊縫處訂合,然後對摺起來。採騎馬釘裝訂時,不但紙張成本低、印刷速度快,閱讀時還可以使題本完全攤開平放,不會中央翹起來,而且使用後也不會留有折痕。

6. 若採分開使用的答案紙,其大小最好與題本一致,以便於疊在一起收存


標準化測驗大都以題本與答案紙分開的形式來使用,以節省印製經費,設計時若能使兩者的大小或顏色一致將有利於辨認和保管。

撰寫作答說明

A. 作答說明的內容

測驗卷上印出作答說明的主要目的是在確保能讓學生真正發揮其能力,並測得該試卷所要測的能力。學生不實的低落表現,有時是來自於:(1)不了解作答方法,(2)缺乏充分練習,(3)採用了不適當的應試技巧,而清晰適當的作答說明有助於減少這些干擾因素。

1. 教師自編測驗的作答說明

教師自編測驗時所用的題型較少變化,學生大都已很熟悉作答方法,所以其作答說明通常是非常簡短,有時候甚至只有一個標題而已,如「是非題」、「填充題」等。但在較正式的測驗中或使用較新穎的題型時,還是應該有指導語。
而各種題型的配分比例則是教師自編測驗所獨有的,因為師生之間已經習慣每一次測驗都以一百分為滿分,所以在作答說明中要註明每種題型在總分中所佔的比例,或者是每一題所佔的分數,以便學生安排他作答的優先順序。

2. 標準化測驗的指導語

標準化測驗的作答說明(指導語) 內容較多,通常單獨佔了一頁,它至少要包括:
(1)測驗目的。這段要告知學生測驗的名稱及它所測的能力。
(2)作答方法。這部份要告知學生作答時應有的思考程序或操作程序,以及標示答案的方法及位置。
(3)試題範例。常見的題型只用一題,罕見的則用兩三題當作練習題,用以助學生瞭解並熟悉作答方法。
(4)有關於猜答的建議及提前做完時應如何的規定。
(5)特殊規定。例如是否可以使用草稿紙、計算器、換算表等。
(6)作答時間限制。通常是以分鐘為單位,並在最後一行用較大的阿拉伯數字標示出來。
(7)有助於提昇測驗表現的應試技巧。這部份不一定需要,但若知道某些應試技巧會很明顯的影響到測驗分數,就應該提醒受測者,免得讓它變成一個干擾分數的因素。

B. 作答說明的編寫原則

@ 所用的字彙要淺顯,句子要短,使文字可讀性提高。
@ 愈是新穎的題型就愈需要藉著範例來詳細說明其作答方法。
@ 若試卷版面不夠,則常用題型的作答說明可以加以精簡。
@ 在標準化測驗中各個分測驗的作答說明,其格式要前後一致。
@ 國小低年級學生最好不用書面的作答說明,應該改由主試者以口頭說明。

試題的審查

A. 擬題原則的審查

「選擇反應式」的題型之下,有各種題型的擬題原則,「建構反應式」的題型之下,也有各種題型的擬題原則,以下所介紹的則是各種題型皆通用的擬題原則。

@ 除了語文測驗外,要盡可能降低字彙的難度及句子的複雜度。
@ 文字要精簡,以便減少試卷篇幅及閱讀所需時間。
@ 所提的問題要清楚明確,沒有第二種解釋。
@ 要確定每一試題所考的是內容領域裡的重要概念,而非旁枝細節。
@ 同類型的試題中,各題的格式、語法要前後一致。
@ 取材時要避免偏袒某類受試者,以確保測驗的公平性。
@ 撰寫題目時要隨時參考各種題型的命題原則。
@ 要比實際需要量多擬百分之五十的題目,以備檢查、比較後淘汰。
@ 客觀計分的試題,一定要備有各專家都能同意的正確答案或最佳答案。
@ 寫好後過幾天,再自己檢查一次,或請同事檢查,以避免個人的盲點。

B. 公平性的審查

公平性的審查是要找出有偏差的試題,所謂試題偏差(Item bias)是指該試題的內容或敘述方式可能讓某些群體引起不必要的情緒反應或覺得不公平;或是回答該試題時需要用到與測驗目的無關的能力,而使得某些群體處於不利的地位。判斷是否有試題偏差最好要找不同性別、不同種族、不同社經地位或不同性質學校來源的成員來逐題評鑑。
有經驗的審查人員會從認知、情感、及生理三方面找出可能造成分數變動的無關變異量(指與所測量的構念無關,但卻會影響實得分數的變項)

1. 要避免認知方面的無關變異量

a. 排除不必要的深奧詞彙。  除了語文科測驗之外,考試題目中若使用了不必要的深奧詞彙,就會變成在考語文理解能力,不只有利於語文能力佳的考生,也會使測驗效度降低。
b. 排除與構念無關的知識與經驗。 除了少數特殊性質的測驗外,試題內容若涉及軍事、地區主義、宗教、運動、特殊工具、政治意識形態等,通常會對缺少該知識或經驗的考生不利。

2. 要避免情感方面的無關變異量

選擇閱讀材料或邊你試題時要避免包含與構念無關卻易引發情感反應的議題。例如:意外、疾病和天然災害、死亡和頻死、種族或性別等群體之間的歧視、幽默、嘲笑和諷刺、對於不同國家人民的刻版印象、另有負面涵義的文字、奢華行為、對某宗教的褒貶、性行為、物質濫用(菸酒、毒品)、自殺或自傷行為等等,都容易引發考生的情感反應,讓某些人覺得被歧視、被冒犯,進而影響其作答的情緒和意願。

3. 要避免生理方面的無關變異量

在審查試題內容時,很難找出生理方面的無關變異量,除非它已經印製成正式測驗,或許可以看出是否有印刷不清、裝訂錯誤、作答位置太小的問題。但是在考試過程中,生理方面的無關變異量造成的影響比較明顯,例如,考場中的光線不足、噪音干擾、桌椅不舒適等,另外,遇到殘障學生(視障、聽障、腦傷、肢體殘疾等),而需要輔具或或變更試題呈現方式或作答方式,這些都是在排除生理方面所造成的無關因素。

評鑑時任何有偏差嫌疑的試題都應該拿出來公開討論,只要懷疑者能夠說服其他人,該題就應該刪除或更改,不可以未經過討論就以表決方式決定去留。以下是供審查人員使用的試題偏差檢核表:

1 評鑑試題偏差的檢核表
  1.題目中沒有對於次級團體的攻擊性的內容。
2.
題目中沒有對於次級團體的攻擊性的用詞用字。
3.
題目中沒有次級團體可能不熟悉的活動或情境。
4.
題目中沒有對於次級團體的刻版印象。
5.
題目中沒有會助長對次級團體刻板印象的內容。
6.
題目中沒有不必要的艱澀字詞或複雜的句型結構。
7.
題目的格式應該是任何次級團體所熟悉的。
8.
題目的內容應該是任何次級團體所熟悉的。
9.
解答題目所需要的技巧應該是任何次級團體所熟悉的。
10.
提供題目訊息的方式不會使次級團體成員覺得難堪或困惑。

C. 內容的審查

對於草擬試題優劣的評鑑,有兩種方式,一種是經驗判斷法,一種是實證研究法。經驗判斷法又稱「試題內容審查法」,它是找一些相關的人來,並依據一些評鑑標準對編擬好的試題內容做評鑑。有關的評鑑標準、評鑑人員資格及人數、對評鑑結果一致性的要求等都經過整理列在表2中。
至於使用哪些評鑑標準則是由測驗目的來決定,並不是所有標準都得同時使用,但通常不論哪種測驗都有好幾個標準可以適用。

表2 以「試題內容法」評鑑試題的摘要表
評鑑標準
       
     
評鑑者人
結果是否
應該一致
答案正確性
標準答案是否正確?
學科及測驗專家
少許
題意明晰性
是否符合題目編寫標準?
表達是否清楚?
學科及測驗專家
學生
少許
很多
也許
答題難易度
試題難易程度是否恰當?
教師、學生
內容重要性
此一知識技巧是否重要?
學科專家、教師
也許
試題偏差
是否會讓特定團體成員覺的不公平?
各種團體成員
可能不
與測驗計畫符合性
試題是否符合教學目標或命題計畫的界定?
學科及測驗專家
少許
也許
與課程關連性
試題所要測的知能是否出現在課程教材中?
學科專家、教師
很多
不必,但越高越好
與教學關連性
學生是否有充分機會學到試題所要測量的知能?
教師、學生
很多
不必,但越高越好

1. 答案的正確性

答案的正確性是指該題目的標準答案是否取得各專家的一致同意。判斷程序是在該題已經完成所有編改程序後,請多位對該題目所評量的內容深具學養的專家來獨立作答,若答案有不一致,則應該透過相互討論來取得一致;若意見仍不能一致,則該題應該廢棄,絕對不可以採用表決來決定標準答案。

2. 題意的明晰性

題意的明晰性通常是指題目的用字淺顯、精確,句子結構簡短,且格式前後一致,學生不會因為命題者的表達方式而產生困惑。明晰性高的題目可以降低語文理解能力與一般智力對測驗分數的影響,提高學科成就測驗的效度。

例題1
(    )1.
辨別太白粉的方法是什麼?(題意不清)
          A.
加水   B.加食用醋   C.用聞的   D.加碘液
(    )2.
哪一種是辨別太白粉的方法?(較佳)
          A.
加水後會溶解   B.加食用醋會起泡   C.聞起來香香的  D.加碘液會成蘭紫色

3. 試題的難易度

難易度是指全部受測學生答對該題的人數比率。只根據試題內容來判斷試題的難易度確實不容易,尤其是面對新的題型或新的教學單元時,因為缺乏類似題目的經驗,即使是資深教師也難以掌握它的難易度。此一評鑑標準若可以的話應該改用學生實際答對比例來推估。
教師對試題難易度的初步估計可作為預試時排列試題之用,然後再以試題分析求得的通過率取代之。但若無法進行預試及試題分析,那教師的難易度估計將是編排試題的唯一依據,這時可以根據多位教師對該題難易度估計的平均值來排列試題。

4. 內容的重要性

所謂內容的重要性是指該題目所測量的知識技能是課程的最核心部份、或是勝任某一工作所必備的、或是進入下一單元學習所必需的。當我們對題目做重要性的判斷時,最好指出其參照點(如,對......而言是重要的),同時應該容許它有程度上的區分(如,非常重要、有些重要、有關係、無關的)。

5. 與測驗計畫的符合性

一般而言,測驗命題計畫會對教學目標、試題格式、刺激屬性、認知層次、誘答產生原則等都有詳細的敘述,以作為對試題的「界定」(或稱試題規格)。而符合性是指請學科及測驗專家來判斷該試題是否符合命題計畫上的界定
判斷試題與其界定的符合程度是一件技術性很高的工作,評鑑者常需要親自作答,以推論回答該題所真正需要的認知或其他能力。由於題目所測量的內涵有部份取決於學生的學習或其他經驗,而評鑑者常因為對學生經驗了解不夠,而平添了判斷上的困難,例如專家認為可以測量學生應用能力的試題,很可能教師已經當作例題講解過了,因此實際只能測到學生的記憶能力。
另外,評定整份測驗的所有題目是否能夠充分代表所欲測量的內容領域,也是很重要,這種把所有題目與命題規格明細表 (Specification) 做比對的過程稱之為「內容效度的驗證」。

6. 與課程的關連性

當專家們認為試題內容與學校課程內容或職業訓練課程內容相符合時,它即具備了「課程效度」。若該測驗是用來為某一職位篩選合格人員時,它的試題就必須與該職位的工作分析結果或職業角色描述有密切關連。

7. 與教學的關連性

「與教學的關連性」又稱為「教學效度」是指教學評量或畢業資格考試等的試題是否與學生的實際學習內容有密切關連。藉著調查教師所用的教材及教學進度可以評估部份的教學效度;但最直接的方式還是直接詢問教師(和學生),看測驗所考的知識和技能是否他們教(或學)過。此時應注意的是,問題重點不在於題目內容是否在課堂上討論過,而是學生是否都有公平機會學習解答該題目所需要的知識和技巧。

2016年9月20日 星期二

測驗對於社會的貢獻

1. 促進社會流動, 達成社會的動態穩定

  • 古代科舉考試
  • 公務人員高普考
  • 公務員升等考試
  • 公費留學考試
  • 研究所入學考試
  • 專業證照考試(醫師、律師、建築師、心理師…..)

2. 提升人員同質性與適切性, 提升機構運作效率

  • 升學考試(大學、研究所入學考試)
  • 雇用測驗
  • 資優班甄選
  • 啟智班甄選
  • 分類(職類分配)與安置(能力分班)

3. 檢驗工作必要知能, 保障社會大眾生命財產安全

  • 各類駕駛執照考試
  • 專業證照考試(醫師、律師、建築師…)
  • 技能檢定考試
  • 語文能力檢定考試
  • 教師資格檢定考試

4. 增進個人自我瞭解, 使人盡其才,才盡其用

  • 綜合性向測驗
  • 職業興趣測驗
  • 工作價值觀量表
  • 目標:個人的充分自我實現

測驗的分類方式

依受測人數分

個別測驗、
團體測驗、
全國性大規模測驗、
國際性大規模測驗

依測量目的分

最大表現測驗、
典型表現測驗

依作答方式分

紙筆測驗
    寫在題本上
    寫在答案紙上
操作測驗、
電腦測驗、
口語測驗

依試題呈現方式分

固定順序測驗、
適性測驗

依材料形式分

語文測驗、
非語文測驗

依標準化程度分

教師自編測驗、
甄選考試、
標準化測驗

依題目排列方式分

同類群聚式(分測驗式)
混合螺旋上升式

依計分者分

人工計分、
機械計分(光學感應)、
電腦計分

依計分結果客觀性分

客觀計分測驗、
主觀計分測驗
  整體式
  分析式

依解釋結果的參照基準分

常模參照測驗、
標準參照測驗

依行政決策分

篩選(screen)
選拔(selection)
分類(classification)
安置(placement)
診斷(diagnosis)
績效考核(accountability)

依對考生利益的影響分

高注碼測驗(high-stakes test)
非高注碼測

依結果的運用領域分

教育測驗、
臨床測驗、
職業測驗、
諮商與輔導測驗、
心理研究用測驗、
軍事用測驗

依測量的心理特質分

智力測驗(學校能力測驗、學術性向測驗)
性向測驗(能力傾向測驗)、
人格測驗(性格測驗)、
成就測驗、
神經心理測驗

2016年9月19日 星期一

心理測驗發展史大事年表

紀元前

  • 2357(BC)帝堯(尚書堯典)創考試制度(文官登庸與升遷的筆試制度)
  • 165(BC)漢文帝15年昭書士子就四項(朕之不德、吏之不公、政之不行、民之不寧)發言,為我國口試濫觴

紀元後

  • 604(AD)隋大業二年正式建立科舉制度
  • 1073 宋神宗四年廢詩文,以經義取士
  • 1219 義大利波勞納大學(University of Bologna)初次使用法律的口試
  • 1384 明洪武17年恢復科舉,試以制義(八股);清代研習明制,為科目增為常科、特科及編譯科三類;直到1905年清光緒31年才廢除科舉。
  • 1575 華爾特(J. Huarte),出版「智巧的測量」(Examinen de Ingenios)一書,討論心理能力的個別差異比較。
  • 1599 耶穌會主張運用筆試,為歐洲學校採用筆試之嚆矢。
  • 1636 牛津大學舉辦授予學位的口試

十九世紀

  • 1837 法國醫生Seguin設計Seguin Formboard測量心智遲滯兒童。
  • 1838 法國醫生Jean Esquirol首先明確區分精神病患和心智遲滯者。
  • 1845 波士頓學校委員會,在教育學者賀瑞斯曼指導下第一次使用筆試。
  • 1862 德國Wilhelm Wundt用校準鐘擺測量「思維速度」
  • 1864 英國小學校長,喬治費舍(Rev. George Fisher) 發展一種包含書法、拼字、數學、聖經知識及其他學科的實例和規範的量表集(Scale Books),使教育測量更客觀,其方法影響了桑代克等人,開啟了二十世紀初的教育科學運動。
  • 1865 美國紐約州創始評議員考試計畫測量全州的教育成就。
  • 1869 英國高爾登(Galton, Francis;1822-1910)出版「遺傳天賦」(Heredity Genius),開始遺傳與個別差異的科學研究,為個體心理學的鼻祖。1883年出版「人類能力研究」。1884年在國際健康博覽會對幾千個民眾施測第一個測驗組合。
  • 1879 德國馮特(Wilhelm Wundt)在萊比錫建立第一座心理學實驗室。
  • 1890 美國卡泰爾(James Mckeen Cattell,1860-1944)初用心理測驗(Mental Test)一詞,他嘗試用測量基本心理官能(如視覺和聽覺的靈敏度、反應時間等)來測量心理能力。1901年Clark Wissler發現這些測驗和大學成績無相關。
  • 1892 美國心理學會(APA)成立。
  • 1893 美國心理學公報(Psychological Bulletin)、心理學評論(Psychological Review)創刊。
  • 1894 Kraepelin 建議在精神病學上使用測驗
  • 1894 美國萊斯(Joseph, M. Rice, 1857-1934)編用拼字測驗。(Spelling Test),萊斯是測驗編製的一位技術開拓者,也是大力提倡以科學方法研究教育問題的先驅。
  • 1896 Witmer 創立第一個心理診所
  • 1897 德國艾賓豪斯(Ebbinghaus, H.,1850~1909)發展語句完成、算術及記憶闊度等測驗,測量智力。
  • 1899 美國大學入學考試委員會(College EntranceExamination Board,簡稱CEEB)成立。CEEB是美國大中學校的共同組織。

二十世紀

  • 1902 Rice 發表算術測驗
  • 1903 桑代克(Thorndike, E. L.1874-1949)出版了《教育測量》教本。
  • 1910 出版書法量表,被譽為近代教育測量之父。其弟子史東(C.W. Stone) 於1908年編製第一個數學測驗。
  • 1904 英國斯皮爾曼(Charles Spearman,1863-1945)用因素分析法,提出智力兩因素(普遍G因素和特有S因素)理論。
  • 1905 瑞士容格(Carl G. Jung,1875-1961)提出字詞聯想測驗。
  • 1905 法國比奈(Alfred Binet,1857-1911)和Simon 發展第一個智力量表。他於1904年應法國教育部之邀,開始發展一種有效、客觀、實用的測量「可教育」兒童的測驗,以鑑定心理能力有限而不能接受正常教學的兒童。
  • 1908 比西量表修訂版引進了心理年齡(MA)的概念。
  • 1909 Goddard 將比西量表翻譯成英文
  • 1910 Thorndike 創編書法量表
  • 1911 Healy 和 Fernald 編製作業能力測驗
  • 1912 Hillegas 編製英語作文量表
  • 1912 德國史騰(Wilhelm Stern,1871-1938)建議智商IQ概念。
  • 1915 tenquist 發表機械能力測驗
  • 1916 美國斯比量表(Stanford- Binet Intelligence Scale)問世,由托孟(Terman E. L.) 編製修訂自比西量表,為第一個採用I.Q.解釋分數的測驗。1937,1960,1986多次修訂。
  • 1917 團體智力測驗誕生。美國心理學者Robert Yerkes等人編製了陸軍甲種測驗(Army Alpha Scale)和陸軍乙種測驗(Army Beta Scale),後者為非語文測驗。
  • 1917 自陳式人格測驗問世。由吳偉士(Woodworth, R. S., 1869-1962) 編成個人資料表格(Personal Data Sheet) 應用於第一次大戰期間,美軍檢定士兵的不良適應。
  • 1919 美塞氏(Thurstone L. L.1887-1955)編大學新生心理測驗問世。
  • 1921 羅夏克墨漬測驗(Rorschach Ink-blot Test)初次出版。
  • 1921 美國心理學公司由卡泰爾等人(Cattell, J. M., Thorndike, E. L. &Woodworth, R.S.) 創辦,是第一間出版測驗的公司。
  • 1922 中華教育改進社邀 McCall 來華協助編製各種測驗。
  • 1923 美國第一個成就測驗組合編製成功,由Madden, Gardner,Terman, Ruch等編成史坦福成就測驗(Stanford Achievement Test),內容包括語文、數學、文學、史地、科學和拼字等,採用K分數記分。
  • 1926 Goodenough (1886-1959)發表畫人測驗(DAP);SAT首次使用
  • 1926 古氏畫人測驗(Goodenough Drawing-A-Man Test) 出版。
  • 1926 美國Carl C. Brigham為大學入學考試委員會發展了普通語文和數量技能的客觀測驗,即所謂「學業性向測驗」簡稱SAT,以補充教材成就的申論式考試。該項測驗每年均有修訂與改進,1972年 Dubois 在 7th MMY 評論是項學業性向測驗,已達到心理計量學上的技術尖峰。
  • 1927 「史創職業興趣量表」(Strong Vocational Interest Battery,簡稱SVIB)男用本編成問世。
  • 1929 塞斯通(Louis L. Thurstone,1887-1955)編製一些態度量表。
  • 1934 莫雷諾Moreno,J. L. 出版「誰會繼續生存」,開創社會計量。
  • 1935 塞斯通(Thurstone, L. L.)提出智力多因素論,有七種基本心理能力。Murray發表主題統覺測驗(TAT)。IBM推出第一個實用的電動測驗記分機。
  • 1935 美國莫瑞(Murray, H.A.,)出版「人格探查」,書中報告理論與若干技術及主題統覺測驗(Thematic Apperception Test,簡稱TAT)。
  • 1936 美國投射法與人格衡鑑雜誌創刊。研究生入學測驗(Graduate Record Examination, GRE)問世。
  • 1936 Doll編成「文蘭社會成熟量表」(Vineland Social Maturity Scale),用以評量智能不足者的功能水準。
  • 1937 斯比量表第二次修訂成功。有L、M兩個複本。
  • 1937 民26 對日抗戰
  • 1938 班達(Lauretta Bender) 編製「班達視動完形測驗」( Bender Visual-motor Gestalt test),用以評估成熟、腦傷及人格。
  • 1938 布洛斯(Buros,O. K.1905-1978)創編第一輯「心理測量年鑑」(Mental Measurement Yearbook,MMY),二至八輯分別於1941, 1949, 1953, 1959, 1965, 1972, 1978年出版。第九輯由Nebraska大學米契爾(Mitchell, J.V. Jr.)教授主編,由Buros Institute於1985年出版。
  • 1939 Frank 首創投射技術一詞;
  • 1939 魏貝智力測驗出版。魏氏(Wechsler, D. ,1896-1981)在紐約貝爾維醫院(Bellevue Hospital)完成世界上第一個成人用個別智力測驗(Wechsler-Bellevue IntelligenceScale),1955年改稱魏氏成人智力量表(Wechsler Adult Intelligence Scale),適用於16歲至74歲,採用差數智商(DIQ)。1981年修訂簡稱WAIS-R,1999年修訂,簡稱WAIS-Ⅲ。
  • 1941 美國教育與心理測量期刊(Educational and Psychology Measurement)創刊。
  • 1942 明尼蘇達多相人格測驗出版。(Minnesota Multiphasic Personality Inventory,簡稱MMPI),編製者為明尼蘇達大學的郝世威教授(Starke R. Hathaway) 及莫鏗利教授(J.Charmley McKinley)。
  • 1947 美國心理學者期刊(American Psychologist)發行。
  • 1947 美國發展成功兩種多因素性向測驗。包括區分性向測驗(DAT)和通用性向測驗(GATB),前者由Bennett等三人編製;後者由美國勞工部編製。
  • 1947 美國測驗服務社(Educational Testing Service,ETS)成立。。美國教育會、卡內基基金會將他們的測驗計畫與服務讓渡給ETS;另外大學入學考試委員會將其計畫的運作讓渡給ETS,而保留本身作為大中學校政策決定的單位。
  • 1948 美軍戰略服務處界定「心理評鑑」一詞
  • 1948 美國人事心理學(Personnel Psychology) 創刊。
  • 1948 美國Office of Strategic Service用情境測驗甄選。
  • 1950 美國古立森(Gulliksen, H.) 出版《心理測驗理論》
  • 1951 「教育測量」問世。教育測量(Educational Measurement)是由Linquist主編,數十位專家執筆的第一本有關心理測驗編製的專著。
  • 1951 民國40年 政府遷台 中國測驗學會復會
  • 1953 美國心理學會(APA)編行而後於美國心理學者期刊(American Psychologist 18, 56-60, 1963)發表心理學者道德標準(Ethical Standards of Psychologists)
  • 1954 美國心理學會、美國教育研究學會AERA和美國教育測量學會NCME合作制定心理測驗與診斷方法的技術建議。
  • 1954 美國諮商心理學雜誌(Journal of Counseling Psychology)創刊。
  • 1954 Meehl 發表《臨床和統計預測》
  • 1955 Cronbach 和 Meehl 提倡構念效度的概念
  • 1956 美國教育家布魯姆(Benjamin Bloom)團對發展出教育目標分類法,出版認知領域部分,1964年完成情感領域;另外關於動作領域則由辛普生(Simpson)於1966年完成。
  • 1959 美國闞、費二氏提議(Campbell, D. T. & Fiske, D. W.)幅合與區別效度研究。
  • 1959 美國基爾福(Guilford J. P.)提出三向度的智能結構。
  • 1960 斯比量表第三次修訂完成(form L-M),並採用差數智商(DIQ),其標準差為16。
  • 1961 布洛斯主編「出版的測驗」(Buros's Test in Print I)出版。
  • 1963 卡泰爾(Cattell, R. B. 1905-1998)提出流體與晶體的智力理論。
  • 1963 格拉塞(Glaser, R.)在其教學技術與學習結果的測量」文中建議以標準參照測驗(criterion-referenced test)與常模參照測驗相對。
  • 1963 Glaser提出效標參照測驗的觀念
  • 1964 美國「教育測量期刊」及「美國教育研究期刊」創刊。
  • 1964 紐約市各校停止使用團體智力測驗
  • 1965 Kanfer 和 Sas10w 提倡行為技術在心理評鑑上的使用
  • 1966 AERA, APA, NCME共同出版《教育和心理測驗及手冊標準》第一版
  • 1968 民國57年 台灣地區實施九年國民教育
  • 1969 Butctier 報導電腦在明尼蘇達多重人格問捲上的使用;
  • 1969 Jensen 發表有關智力遺傳性和種族差異論文
  • 1971 Griggs vs Duke Power訴訟案判決
  • 1971 桑代克Thorndike, R. L.主編「教育測量」第二版。
  • 1972 McCarthy 發表麥卡西兒童能力量表
  • 1973 Craik 首次發表環境評鑑評論
  • 1974 AERA, APA, NCME共同出版《教育和心理測驗標準》第二版。
  • 1974 魏氏兒童智力量表修訂版(Wechsler Intelligence Scale for Children-Revised,簡稱WISC-R) 出版。
  • 1975 行為評鑑的使用漸增
  • 1977 Mercer 發表多元文化評鑑系統;
  • 1977 兒童人格問捲出版
  • 1977 美國應用心理測量 (Applied Psychological Measurement)創刊
  • 1980 項目反應理論(IRT)出現
  • 1983 考夫曼兒童評鑑組合(K-ABC)問世
  • 1984 「測驗評論」Test Critiques創刊。
  • 1985 AERA, APA, NCME共同出版《教育和心理測驗標準》第三版。
  • 1985 「心理測量年鑑」第九輯出版。
  • 1986 美國心理學會通過「心理測驗電腦使用指南」
  • 1986 Thorndike(1910-),Hagen(1915-),Sattler(1931-)出版史坦福比奈智力測驗第四版(S-B IV)改為四個因素的點量表。
  • 1987 美國精神醫學學會出版「DSM-Ⅲ-R」
  • 1988 臺灣師範大學教育心理與輔導學系修訂「考夫曼兒童智力測驗」,但未正式出版。
  • 1989 美國林因(R. L. Linn) 主編「教育測量」第三版。
  • 1989 明尼蘇達多重人格問卷第二版(MMPI-II),
  • 1989 魏氏學前智力量表第二版(WPPSI-R)修訂完成
  • 1989 成立中華民國大學入學考試中心
  • 1990 Cronbach, L. J. 心理測驗要義第五版問世。
  • 1991 民國80年 通過智慧權法案
  • 1991 魏氏兒童智力測驗(WISC-III)第三版出版
  • 1992 《心理測驗年鑑》MMY第十一版出版
  • 1992 美國心理學會APA出版修訂「心理工作人員倫理守則和行為準則」
  • 1994 美國精神醫學學會出版精神疾病診斷統計手冊第四版「DSM-Ⅳ」
  • 1997 魏氏成人智力測驗英文第三版(WAIS-III)出版
  • 1997 中國行為科學社出版 魏氏兒童智力量表第三版(WISC-III)中文版
  • 1998 網路的發展與測驗的使用
  • 1998 「心理測量年鑑」(MMY)第十三輯出版,由Barbara S. Plake and James C. Impara等人編輯。
  • 1999 AERA, APA, NCME共同出版《教育和心理測驗標準》第四版。

二十一世紀

2016年9月13日 星期二

測驗評量的相關概念


許多學術上的爭論是源自於基本觀點的不同,但也有不少的爭論只是因為對於所用的術語定義不清楚。因此概念分析常是學術討論中最基本的工作,透過概念分析,不但可以使個人的思想更清晰、溝通更精確,也同時避免了許多不必要的爭論。所以在進行討論之前,本文將先釐清測驗、測量、評量、評鑑等這幾個容易混淆的專業術語的含意,以使得後續的討論能夠更加清晰。

一、測量

所謂「測量」(measurement)是指「依據一套人為規則(測量工具)將數字(測量結果)分派到某一事物(測量對象)的某種屬性上(測量變項)的過程」。測量用在自然科學上是指用尺、秤、錶等去度量事物的長度、面積、重量、密度、時間、速度等,這些又稱為「直接測量」。至於教育及心理學領域上所測量的心理能力,則是以抽樣方式選出一套能引起受試者行為反應的心理作業(行為樣本),並依其反應的質與量(指測量結果)去推論其心理能量(知識、能力或人格特質),所以是屬於「間接測量」。

參照點是計算的基礎,任何測量都要有一個參照點。測量的參照點不同,則測量的結果就不能相互比較。長度、質量、時間等的測量以自然的零點作為參照點,若無自然的零點,就以一個共同約定的參照點作為零點,例如:攝氏溫度是以水結冰的溫度為零點;經緯度則分別以格林威治及赤道為零點。在教育與心理方面的測量也需要有參照點,但是心理能力與其作業沒有自然零點,也難以共同決定一個人為零點,因此只好各自建構不同的量尺(scale)採用不同的人為參照點(兩份試卷的試題難易度不同,零分的意義也就不同),測量結果也就難以互相比較。

「測量」和當作動詞用的「測驗」常被混用,雖然測驗的結果也常常以數目字表示,但並不是所有的測驗都是如此,例如臨床心理學用的投射測驗(主題統覺測驗、語句完成測驗等),就不需要將結果數量化。

測量在本質上只是一種將事物的特徵加以數量化的過程,它並不包含質的描述,而且對於獲得的結果也不做任何的價值判斷。

二、測驗

英文的 test 在統計學上被譯成「考驗」或「檢定」,它指的是某一統計量來自於機率的可能性是否大於預先設定的機率,例如:統計學上的 t 考驗、 F 考驗等。test 在工業上常被譯成「檢驗」或「測試」,它指的是檢查某一產品是否符合標準規格,或某一機器能否發揮預期功能。test在教育與心理學界上則被譯成「測驗」,這時它指的是一系列設計來測量人的知識或能力的問題或作業。

在教育與心理學上,test 若是當作名詞來使用,它的定義是「一套系統化的觀察工具,用以取得受測者的認知歷程或行為的樣本的訊息,並由此推論其具有多少某種心理特質或能力」。因此,它本質上是指一種蒐集個別差異資料的工具,大多是指輔導諮商上所用的標準化測驗,如智力測驗、性向測驗、人格測驗等;而測驗的同義詞還包括:量表(scale)、問卷(inventory)。在個別實施的測驗上,偶爾會用「量表」這名稱,例如,斯比量表(Stanford-Binet Intelligence Scale)、文蘭社會成熟量表(Vineland Social Maturity Scale)。至於「問卷」則大部分用於人格測驗上,例如,加州人格問卷(California Psychological Inventory)。

在教育情境中, 有些名詞與測驗很容易混淆。比如,quiz (譯做小考或隨堂考試)通常指授課教師在教學過程中,為了瞭解學生的學習狀況而隨時進行的簡短考試,它並不特別安排施測時間,測量結果也不一定納入學期成績;另外 examination(簡寫成exam.)譯做「考試」則是指比較正式、有特別安排時間,而且通常是行政單位規定要實施的考試,例如:期中考、期末考、畢業考、或入學考試等。

至於 testing 則被當作動詞來使用,它指的是提供刺激以便蒐集反應資料的過程,它有時被譯做「施測」,有時仍被譯做「測驗」。這時我們較關心的是在不同時空下所實施的測驗是否都符合指導手冊上的標準化程序。

三、評量

Assessment 在教育領域常被譯為「評量」或「多元化評量」,而在臨床診斷領域常被譯為「心理衡鑑」。assess 的原先意義是指稅務官員對於貨物或房地產進行估價,以便做為課稅的基礎。後來用在教育上則是指「從多種角度以多種方法去評估個人的知識或能力,以作為教學或輔導效果的證明及依據」。

「評量」和「測驗」的差別在於:測驗只是評量過程中所常用的一種工具而已,但評量還可以透過正式或非正式觀察、作業、練習、寫研究報告、實作評量、作品展示、口頭問答、學習歷程檔案(portfolio)、分析過去成績紀錄等方法來了解學生的學習結果。測驗常因為工具上的限制,只能用一種方法,從一個層面去瞭解學生,但評量卻得透過不同方法(當然包括測驗),從多個層面去對學生做整體性的評估,這也就是所謂的「多元化評量」。

「評量」和「測量」不同的是:測量只是將測量對象的某一種屬性加以數量化,並不涉及比較和判斷,但評量卻是除了數量、質量資料的蒐集外,還包括了解釋資料、綜合各種資料、最後根據教學目標來作比較和判斷。

四、評鑑

「評鑑」(evaluation)是指「將對某人或某事物的測量或觀察結果與依理想設定的標準相比較,並判斷其間的差距,然後賦予價值判斷的過程」。因此,評鑑是在測量之後,而且是合併了其他的訊息(特別是質的描述)之後,對其重要性或所欲性所下的價值判斷。

評鑑的對象可以是個人的專業表現,例如,對於教師教學的評鑑;或者是一個機構的運作效率,例如,對學校、大學科系、或行政單位的評鑑;或者是教學材料的適用性,例如,教科書評鑑、教學媒體評鑑;也可以是指一個政策或計畫方案的實施效果,例如,課程評鑑、對社會福利政策、師資自由化政策、或大型研究計畫的評鑑。

評鑑比評量複雜得多,它通常有多位專家的參與,且比較不那麼重視數量化,雖然它有時也用到測驗或測量技術,但其結果報告含有較多的價值判斷及建議改進事項。

在早年的書籍中,evaluation 和 assessment 是交互使用,不加以區分的,但近年來許多學者已經開始區隔以免造成混淆。