2016年10月17日 星期一

分數轉化與衍生分數

分數的轉化(transformation)具有三個特徵:
  1. 它不改變個人的原始分數,而是用不同的單位來表達這個分數。
  2. 它考慮了原始分數本身不包含的訊息。
  3. 它比原始分數以更富含訊息且容易解釋的方式來呈現個人的分數。

在以下討論的幾個分數轉化方式中,一個比一個複雜,但都具有這三個特徵。

A. 答對百分比

答對百分比(percentage correct)是最簡單的分數轉換方式,通常只用在班級內的學科測驗,而不太可能用到其他測驗上。它是與完美的表現(最高可能分數)做比較,只受個人能力高低與試題難易度的影響,其他人的表現並不會影響到個人的答對百分比。它適於用在效標參照測驗上。
答對百分比是在各種衍生分數中,唯一與教師的理想標準相比較的,在教學上很有參考價值,但千萬不要把它與百分等級相混淆了。其計算公式如下:
                   
X%c = 100 (R / T)

X%c = 答對百分比   
R= 個人答對題數 
T = 總題數(最高可能分數)

B. 百分位置

百分位置分數(Percent placement score)是以團體分數的全距為分母,以個人分數與團體最低分數的差距為分子,所求得的比值;換句話說,它把團體中的最高分與最低分的差距劃分成一百等份,在求個人分數在這一百等份中所佔的位置,它的最高分為100,最低分為0。此分數只是用於班級中的學科測驗,並無其他用途。與答對百分比不同的是,它是與團體的表現作比較。其計算公式為:


X%pl = 100 (X - L) / (H - L)

X%pl = 百分位置分數                 X = 個人原始分數
H  = 團體中最高原始分數        L = 團體中最低原始分數

C. 排名次式轉換

排名次式的轉換並不考慮團體分數的平均數與標準差,它只考慮在某一原始分數上有多少百分比的人高於(或低於)這一分數,因此使用此一轉換方式需要先製作次數分配表。

1. 排名次

將原始分數依高低排列之後,以最高者為第一名,次高者為第二名,依此類推,轉換成名次(Rank);但若遇有相同原始分數分數則將名次加以平均後給予相同名次,例如,第10,11,12名的原始分數相同,則此三人都應該是第11名,而下一個分數則依照前面已經有多少人來賦予名次。以此排列法,若原始分數不精細,則會有多人佔有相同名次,而名次之間也會有空檔。
由於排名次只能看出個人在該團體內的相對地位,不能與其他團體的人相比較,也不能看出學生間差異的大小,所以標準化測驗上絕不可能採用。排名次的方法比較適用於依據總平均成績篩選兩極端的學生,但若經常在評量後公布全部學生的名次,不但侵犯學生的隱私權,也容易造成學生間的惡性競爭。

2. 百分等級

百分等級(Percentile rank; PR)是報導標準化測驗結果時最常用的衍生分數。它是指得到某一原始分數的人,在參照團體中能贏過百分之多少的人。
若原始資料是名次,或已經把原始分數排列成名次,那可以用公式11-6 由名次換算的百分等級。


PR =  100 (RA - 0.5) / N

N = 總人數            RA= 某人的名次

另一種情況是人數較多,難以排列名次,但已經做了次數分配,則可以計算各原始分數組中點的累積次數,再算它佔總人數的百分比。表11-3是一個小樣本的百分等級的求法。



PR =  100 (cmf - (f   x 0.5)) / N  

2百分等級的求法
分數
次數
f
累積次數
cmf
分數中點的累積次數mcmf
百分比
%
百分等級PR
88
2
50
50 - (1×0.5) = 49.5
99%
99
87
2
48
48 - (2×0.5) = 47.0
94%
94
86
4
46
46 - (4×0.5) = 44.0
88%
88
85
2
42
42 - (2×0.5) = 41.0
82%
82
84
5
40
40 - (5×0.5) = 37.5
75%
75
83
6
35
35 - (6×0.5) = 32.0
64%
64
82
8
29
29 - (8×0.5) = 25.0
50%
50
81
5
21
21 - (5×0.5) = 18.5
37%
37
80
4
16
16 - (4×0.5) = 14.0
28%
28
79
4
12
12 - (4×0.5) = 10.0
20%
20
78
4
8
8 - (4×0.5) = 6.0
12%
12
77
3
4
4 - (3×0.5) = 2.5
5%
5
76
0
1
1 - (0×0.5) = 1.0
2%
2
75
1
1
1 - (1×0.5) = 0.5
1%
1

百分等級的優點是它很容易解釋,例如:原始分數84分的百分等級是75,表示得84分的人在該團體中贏過75%的人。但它的缺點就是在中位數附近時,即使分數差距很小,但其相對應的百分等級卻相差很大(因同分人數特別多);但在分數分配的兩端時,卻是分數相差很大,但其對應的百分等級卻相差很小(因同分人數特別少),這現象在偏態分配上更是明顯,此外它是等級資料不能進一步做數學運算。

C. 等第式轉換

將原始分數依高低劃分成少數幾個等第是一種化約式(reductive)的轉換,換句話說,新分數比原來分數的階層數減少了許多。使用這種轉換法通常是為了:(1)簡化分數的處理,(2)降低分數差異的敏感性。

1. 標準參照式的等第轉換

標準參照式等第轉換是一種將分數對照外在標準(由專家或教師所設定)之後,再化約成等第的轉換法。在使用上常可以配合上述的「答對百分比」、「百分位置」,或者是國內班級考試常用的「百分制評分法」來設定轉換標準。例如:答對80%以上者給A 79%-70%者給B 69%-60%者給C 59%-50%者給D 50%以下者給F
此法在設定轉換標準時,是依據學生對教材的精熟水準及教師的經驗判斷,並不考慮每一等第應佔人數的百分比,因此並不能由其等第知道該學生在團體中的相對地位。

2. 常模參照式的等第轉換(常態化等第轉換)

常態化等第轉換是把每一個等第應佔人數的百分比,事先依據常態分配的原則(中間最多、向兩端遞減、左右對稱)設定好,然後將每個人的分數依照高低排列,再由上而下,或由下而上把每一等第塞到額滿,然後再塞下一個等第;個人所分發到的位置即此人分數轉換後的等第。
常態化等第轉換是一種團體內的相對比較法,較常見的有下列四種,下列各表中第一行是「等第名稱」,第二行是各等第的「應佔百分比」,第三行是「累積百分比」。

1. 五等第(五分制)

五等第制的常態化等第轉換是學校報告學期成績時最常用的轉換方式,但在標準化測驗中卻因為不夠精細而未被採用。
轉換後等第   F(1)    D(2)     C(3)     B(4)     A(5)
百分比           7%     24%     38%     24%       7%
累積百分比   7%     31%     69%     93%    100%

2. 標準九

標準九(Stanine score)是把所有的分數簡化成九個等級,而每一個等級所佔的人數比例是按照常態分配的原理來指派的。標準九、標準十、C量表分數都是以標準分數的樣式呈現,但在換算上是依據贏過人數百分比及常態分配原理而來,所以又稱為「常態化標準分數」(Normalized standard score),其中又以標準九最為常用。
轉換後等第   1        2       3        4        5         6       7          8          9
百分比         4%     7%   12%   17%   20%   17%   12%     7%       4%
累積百分比 4%   11%   23%   40%   60%   77%   89%   96%   100%

3. 標準十

標準十(Sten score)和標準九類似,是左右各五個單位的常態化標準分數。
轉換後等第   1      2       3         4        5       6       7        8       9         10
百分比         2%   5%    9%    15%  19%  19%  15%    9%    5%       2%
累積百分比 2%   7%   16%   31%  50%  69%  84%  93%  98%   100%
 

4. C量表分數

C量表分數(C-Scaled score)除了兩端各多出一個等第(0 10)之外,其餘與標準九相同。
轉換後等第  0    1       2      3       4       5       6       7       8       9       10
百分比        1%  3%   7% 12%  17%  20% 17%  12%    7%    3%     1%
累積百分比1%  4% 11% 23%  40%  60% 77%  89%  96%  99% 100%

D、線性標準分數(直線轉換)

「直線轉換(Linear transformations)是指當所有的分數加減或乘除一常數後,各分數之間的相對位置仍然保持不變。由於將轉換前和轉換後的分數若分別以座標圖上的 X軸和 Y軸來表示(見圖11-6),則兩分數的對應關係成一直線,故稱為直線轉換,此時所加、減的常數就是該直線的截距(a) ,所乘、除的常數就是該直線的斜率(b)






      11-6  直線轉換的圖示

每一分數加減一常數之後會使平均數產生相對的移動,而乘除一常數之後會使標準差擴大或縮小;經直線轉換後的那組分數雖然平均數、標準差會有變化,但各人的相對次序仍然不變,所以常被標準化測驗用來建立統一的分數系統,以便於解釋測驗。比較常見的直線轉換分數有:z分數、T分數、AGCT分數、離差智商(DIQ)CEEB分數。

 z 分數

z分數是最簡單,也是最基本的標準分數,它是以標準差為單位,來說明某一原始分數是位於平均數以上或以下幾個標準差的位置上。它是將每個原始分數減去一常數(平均數),再除以一常數(標準差)的直線轉換方式變成一組以平均數為 0,標準差為 1 的標準分數,其轉換公式如下:

                     zi = (Xi-M) / SD

 X = 個人原始分數
 M = 所有原始分數的平均數
SD = 所有原始分數的標準差

轉換後的分數有99%是落在+3.0到-3.0之間, z分數因為有一半的分數是負的,且常帶有小數,與一般人對分數的概念不同,很難溝通;所以除了對專業人員外,一般都用其他的標準分數來報導。許多其他的標準分數都是以 z分數為基礎作第二次的直線轉換。下列的線性標準分數就是利用Z分數再做一次直線轉換的。

 T 分數

T 分數是最早出現的二次轉換標準分數,它將每一 z分數乘以10,以消除小數;再將每一 z分數加上50,以消除負數。它是轉換成以平均數為50,標準差為10的標準分數,其轉換公式及範例如下:

              T = 10z + 50

133z分數轉換成T分數的範例
z 分數                10z + 50 = T分數
z = +3.8            10(+3.8) + 50 = 88
z = +1.4            10(+1.4) + 50 = 64
z =  0.0            10(+0.0) + 50 = 50
z = -0.9            10(-0.9) + 50 = 41
z = -2.3            10(-2.3) + 50 = 27

 AGCT分數

AGCT分數是美國陸軍普通分類測驗(Army General Classification Test)所用的標準分數系統,其他性向測驗(如通用性向測驗GATB)也採用。它是轉換成以平均數為100,標準差為20的標準分數,其轉換公式如下:

          AGCT = 20z +100

離差智商

早年所謂的智商是比率智商 (ratio IQ),它是心理年齡和實足年齡的比值。而離差智商(Deviation IQ., DIQ)才是現代各種智力測驗所常用的分數系統,它是轉換成以平均數為100,標準差為15(如:魏氏智力量表)的標準分數。魏氏離差智商的轉換公式如下:

         D.I.Q. = 15z +100

CEEB分數(或稱ETS分數)

CEEB分數是美國大學入學考試委員會(College Entrance Examination Board)所使用的一種分數系統,而美國測驗服務社(Educational Test Service)的各類大型測驗(如:SATGRETOEFL等)也使用此一分數系統來報導測驗結果。它是轉換成以平均數為500,標準差為100的標準分數,其轉換公式如下:

CEEB = 100z + 500

由於大型測驗中受測人數眾多,擴大標準差和平均數的數值可以大量減少同分的人數。

E、常態化標準分數(面積轉換)

常態化標準分數(normalized standard scores)的轉換方式不是採用直線轉換,而是採用面積轉換(area transformation),其轉換步驟如下:

1.先就每一個原始分數,依據到其組中點的累積人數,換算成百分等級。
2.使用「常態分配下 z分數與百分等級對照表」(見附錄一)查出與該百分等級對應的z分數。另一方法是把百分等級除以100,化成小數,把它當作常態曲線下不同z分數左端的面積,然後查「z分數與常態曲線下面積對照表」(見一般統計學教科書之附錄),找出其對應的z分數。
3.利用查表所得的 z分數經由前述之公式再轉換成T分數、AGCT分數、離差智商等。

直線轉換是直接以平均數、標準差來求 z分數,所以原始分數的分配若是偏態的,經轉換後的標準分數分配仍是偏態的。但是常態化轉換是先換成百分等級,再查表換成在常態分配下對應的 z分數,所以經轉換後的標準分數的分配一定是常態的。
當受測團體太小或分數分配有明顯的偏態時,改採用常態化標準分數更容易進行分數的解釋和比較。早年國內各個師範學院結業生分發服務時,先將各師院各學系學生的結業平均成績先在該系中轉換成常態化 T分數,再將它放入全省結業生中做比較,即為最好的例子。


131常態分配下各種衍生分數的關係

2016年10月11日 星期二

常模的種類

常模(Norms)是一個樣本團體在某一個測驗上的平均表現,它也是解釋個人分數在團體表現中相對地位的依據。它的製作是以一個測驗對一個具有代表性的樣本團體進行施測,並將所得的原始分數作統計整理,然後就每一原始分數算出其對應的轉換後分數(如百分等級、標準化分數等),最後以分數換算表(常模表)的形式呈現在測驗指導手冊中。

A. 以做比較的對象來分

1. 發展常模

發展常模(Development norms) 是指將個人測驗分數和各種不同年級或年齡發展階段團體的平均表現相比較,以便知道此人的表現相當於在哪一發展階段,它是屬於垂直式的比較。
發展常模有適於嬰幼兒的順序量表、適於學齡兒童的年齡當量、年級當量等。

2. 組內常模

組內常模(Within-group norms) 是指將個人的測驗分數與其性質最接近(同年級或同性別)分組團體的表現相比較,以便知道此人在該團體中的相對位置,它是屬於水平式的比較。
組內常模又可分成兩類,一類是以團體測驗分數的平均數、標準差為計算基礎的標準分數系統,如:z分數、T分數、AGCT分數、CEEB分數;另一類是以個人在該團體中的排列等級為基礎的,如:百分等級、十分等級、標準九。

B. 以取樣範圍大小來分

如果以建立常模的樣本人數及代表性來分,可分為全國性常模、地區性常模、及特殊團體常模三個層次。

1. 全國性常模

全國性常模(National norms)是標準化測驗必備的常模。它是以該測驗在全國的適用對象為取樣範圍,重視常模樣本在區域、性別、種族等方面的代表性。測驗指導手冊上的常模幾乎都是全國性常模。

2. 分組常模

分組常模(Subgroup norms))的樣本是取自整體常模,比如,以性別、年齡、學校年級、種族、社經地位、職業、或居住地區等變項進行分組。
只有在上述變項上,不同群體的測驗平均分數有顯著差異時,才提供分組常模,否則就直接使用整體常模即可。
只用整體常模或只用分組常模進行解釋 ,端看施測目的而定。在很多情況下,整體常模和分組常模同時使用,更能夠增進測驗的解釋力。例如,在美術性向測驗上,告知學生他在全國常模上百分等級是70,但在美術班上的百分等級是30

3. 使用者常模

使用者常模(User norms)是以在某一特定時間實際接受這一測驗的人為樣本所建立的常模。例如,台灣的國民中學學生基本學力測驗每一年所用的百分等級常模就是使用者常模。
使用者常模是一種便利取樣的常模,它並不事先計畫要代表某個界定好的母群體,所以使用時要伴隨著對於樣本的詳細描述。

4. 地區性常模

地區性常模(Local norms)是指測驗使用者為了更具體、更詳細的解釋測驗結果,而自己利用現有樣本所建立的常模。這些現成樣本可能是同一學校(區)的同年級學生、同一企業中同一職種的員工、同一職位上所有的應徵者。這些樣本雖然在人數及代表性上都不如全國性常模,但因為與受測者關係較密切,更能配合實際需要,提供有用的訊息。
地區性常模較適合使用在下列幾種情況:一、大量使用的團體測驗。若該測驗只是偶爾使用在少數人身上(如診斷測驗、個別智力測驗),我們便無機會蒐集到足夠的樣本來建立常模,我們別無選擇只能用全國性常模。二、受測者的身分特殊。若大部分受測者的身分明顯不同於全國性常模的樣本(如僑生、原住民學生),可能使用地區性常模較為適當。三、進入其他團體時。雖然有時全國性常模也很適當,但我們可能更想知道受測者在新團體中的相對地位,以便預測他的適應情形。

5. 特殊團體常模

特殊團體常模(Special group norms)可以分成兩類,一類是特殊教育中所需要的「特殊學生常模」,這類學生常因為生理上的障礙﹝如;視障聽障﹞而修改了標準化施測程序,自然不宜與正常學生相互比較,因此有必要為相同條件的學生另建常模。
另一類則是指進行職業輔導時所用的「特定職業常模」。測驗編製者為了要讓輔導人員能夠明確說明某人的測驗結果最適於從事某一種職業,他必須找一群某一特定職業的資深從業人員進行人格、興趣和性向測驗,並找出最適於該職業的人格特質或興趣、性向組型;解釋時輔導人員將學生的各種測驗結果和特定職業常模相比對看他較適合從事哪一種職業。

C.以比較的單位來分

1. 國際性常模

近十年來,對於學校學習成就的國際性比較非常盛行。比如像TIMSS(Trends in International Mathematics and Science Study)PISA (the Programme for International Student Assessment),參與的國家都是經濟上先進的國家,他們提供該國家學童的代表性樣本參與研究,但在比較與解釋時是以國家為單位。
國際性常模(international norms)由於參與的國家數不多,因此這些國際評量方案通常是以各國的總平均分數,或是對於個別題目的答對百分比來進行解釋,在此情況下,百分等級和標準分數常模是沒有多大用處的。

2. 機構常模

有時候,教師或行政人員想要知道自己的學校在所有學校中所佔的位置時,就需要以學校的平均數為單位來建立常模,此種機構常模(Institutional norms) 又稱學校平均數常模 (School-mean norms)
由於以團體平均數建立的常模的變異數比較小,一個人若無法仔細區分「以個人分數建立的常模」和「以團體平均數建立的常模」,就會造成很大的混淆。舉例來說「忠孝國中的平均分數在國家常模中的百分等級是90」,很多人就會解釋為「在忠孝國中的一位中等的學生,其能力贏過這國家90%的同年齡學生」;但實際上,這位得分等於該校平均數的學生,其分數在「以個人分數建立的全國常模」中,百分等級可能只有60

D.以常模表的排列格式來分

常模表(Norms tables)常附於測驗指導手冊之後,以供測驗使用者將原始分數換算成標準化分數或百分等級,常模表依據資料的排列方式可分成下列數種:

1. 簡單常模表

簡單常模表(Simple norms tables) 只有一欄原始分數和一欄衍生分數的常模表。它在形式上是最簡單,但在印刷上及查表時間上卻最不經濟。

2. 多組別共用的常模表

若是將依據不同組別(年級、性別)建立的常模合併在一個表上來使用,將會呈現有一欄原始分數,而有多欄不同組別的衍生分數。這種多組別共用的常模表(Multiple-group norms tables),可以使一種衍生分數只需要一張表,不但減少印刷成本,也比較容易看出同一個原始分數在不同組別中的相對地位。

3. 多種分測驗共用的常模表

若是一套測驗中含有多個分測驗(如綜合性向、綜合成就測驗),或是能算出多種分數(如診斷測驗、多因素人格測驗)時,則可以把同年齡組同一衍生分數的不同分測驗的常模表合併在一起,稱之為多種分測驗共用的常模表(Multiple-subtests norms tables) ,這樣使用者可以使用一張表就查出受測者在不同分測驗上的同一種衍生分數。
這種常模表不只是節省印刷成本,而且查表時不必常翻頁,效率較高,非常適合用在綜合性向測驗上。但如果分測驗之間,題數差距很大就不適合併在一起呈現出來。

4. 多種衍生分數共用常模表

若是一套測驗中能算出多種衍生分數(如百分等級、標準九)時,則可以把同年齡組的不同衍生分數的常模表合併在一起,稱為多種衍生分數共用常模表(Multiple-score norms tables),這樣使用者可用一張表就查出受測者的同一分測驗的所有衍生分數。這種常模表不只是節省印刷成本,而且查表時不必常翻頁,效率較高(其形式類似附錄一的對照表)。

5. 簡略式常模表

當原始分數全距太大時,而且不同的鄰近分數常換算出相同的衍生分數時(如速度測驗),有些編製者會以等間隔的方式,只取部份原始分數(如,0, 5, 10, 15, 20,...)來建立簡略式常模表(Abbreviated norms tables) 。使用者若遇到未呈現出來的原始分數分數,就得自己用內插法求出衍生分數。這種常模表雖然省了印刷成本,但增加使用者的查表時間和計算工作,且容易造成錯誤,不值得鼓勵。

6. 濃縮式常模表


濃縮式常模表(Condensed norms tables)和上述簡略式常模表很像,只不過是它將衍生分數做等間隔的部份呈現(通常是百分等級,如,1, 3, 5, 10, 15,...)。在該測驗並不需要做精細比較時,使用這種常模表即可。

如何增進評量結果的信度

1. 增加評量程序的長度。

在實務上可行的範圍之內,增加作答時間、增加試題數、增加觀察次數等等。

2. 擴大評量程序的取樣範圍。

評量程序要涵蓋最大學習表現所有基本、重要的刻面,設計出周延、詳細的內容取樣明細表,以免評量結果以偏概全,造成下次再評量時產生極大的差異。

3. 選擇比較能區辨學生能力的評量任務。

要選擇鑑別力高的客觀計分試題,或學生得分變異大的主觀計分試題,而剔除對學生而言太簡單或太難的,就可使學生之間分數的變異達到最大。

4. 減少猜測因素的干擾。

試題的題意要清晰,不能做第二種解釋;給予作答時間要足夠,以免到最後有太多的盲目猜答情形;實作任務的說明要詳細,以免學生各自解讀,而最後作品難以比較。

5. 增進評量程序的公平性。

要防止外來干擾因素,例如,考場有噪音或外人闖入、學生考試時作弊,或在作業上抄襲他人等;對於特殊學生,如殘障或非母語的學生要有特殊的安排,以免其生理障礙或語言的精熟度影響其評量。

6. 增進評分的客觀性。

使用系統的、更正式的方式來進行對學習表現的評分,例如,評分人員要事先訓練、使用參考答案或評分規程。

7. 合併多個評量結果。

當評量用於重要教育決策時,最好使用多位獨立的評分人員,或是合併多個使用不同評量方法的結果。