7.測驗的施測
標準 3.18
對於有時間限制的測驗,在確認測驗測量了設計測量內容領域的前提下,測驗編製的調查中應該檢查分數中包含速度部分的程度,並評鑑這一部分的合適性。
標準 3.19
測驗指導語應該要能掌握重點並清楚明確,這樣別人才能夠恰當地重複施行測驗的條件。而信度、效度研究以至常模的數據資料都應該在這種標準化的條件下蒐集。
說明:因為包括學校、工廠企業、和醫療單位在內的所有施測人員都需認真遵守測驗實施上的規定,所以施測人員接受具體的施測指導和施測步驟的說明,就變得非常重要。
標準 3.20
給予受測者的作答指示應該足夠詳細,以使受測者能夠按照測驗編製者的意圖來答題。若可以時,應該在測驗之前提供給受測者樣本材料,比如例題和練習題、評分規程、以及每個主要單元的代表性試題,或是將此類材料作為標準化施測說明的一部分。
說明:例如,在人格量表裡,可能希望受測者以第一反應來答題。那麼這個期望就應在量表的指導語裡清楚講明。再例如,在興趣和職業調查表的說明裡,要求受測者具體標明哪些是他們理想中想做的活動,和那些他們實際認為有機會和有能力做的事情就可能很重要。
練習材料的性質和程度依據對受測者知識程度的期望而定。例如,如採用一種新型的測驗方式時,給予受測者練習的機會就很重要。在有些施測情形下,說明猜題和時間限制,對於測驗分數的影響可能也很重要。
若允許詳細描述測驗說明的話,上面做法的條件須以一般規則的形式再加上有代表性的例題清楚地加以闡述。若詳細描述不允許的話,也須明確說明。測驗發行單位應在材料中包括處理受測者典型問題的指導。測驗使用者也應當被告之,要如何處理測驗期間出現的問題。
標準 3.21
如果測驗編製者指明在受測者之間,或不同受測者次群體之間,允許施測的條件有變化的話,要確認該條件可變化的範圍,以及用書面說明允許有不同施測條件的理由。
說明:在決定施測條件是否可以變更時,測驗編製者必須考慮並研究不同施測條件所造成的可能效果。如果施測條件不同於測驗編製者所研究的條件,或不同於建立常模的條件時,那測驗分數的可比較性就會被削弱,而常模的應用也會受到質疑。
務要牧養你們中間的羊群,按著上帝的旨意照顧他們。不是出於勉強,而是出於甘心;不是因為貪財,而是出於熱誠;也不是要轄制託付你們的羊群,而是作他們的榜樣。 彼得前書 5:2-3 聖經新譯本(NIV)
2011年10月16日 星期日
2011年10月3日 星期一
測驗編製步驟(5)及其對應的教育與心理測驗標準
5.測驗設計與編輯
標準 3.7
編擬、審查、檢驗試題、和從題庫裡選題的程序必須作成書面說明。
如果是根據測驗規格明細表分類成幾個單元時,分類的程序和單元的準確性及合適性都須作成書面說明。
說明:實證證據或專家仲裁可用於根據測驗內容細則而作的單元試題分類。例如,專家小組可將試題分類,或是判斷測驗編製者的單元劃分是否合適。挑選專家小組成員和確定程序要非常謹慎,因為兩者都將影響分類的準確性。
標準 3.8
在進行試題預試(item try out)時,挑選參加預測的受測樣本的步驟,和終極樣本的特性都應作成書面說明。
在分派樣本時,應儘量使參加預試的對象能夠充分代表各個次群體。
說明:導致預試樣本相對於其整個預期群體,在解題時可能出現的些微差異狀況,應該適時作成書面說明。比如說,當接受預試的受測者知道他預試的分數對他沒有任何利害關係時,他們的做答動機就不會像正式受測者那麼高。
標準 3.7
編擬、審查、檢驗試題、和從題庫裡選題的程序必須作成書面說明。
如果是根據測驗規格明細表分類成幾個單元時,分類的程序和單元的準確性及合適性都須作成書面說明。
說明:實證證據或專家仲裁可用於根據測驗內容細則而作的單元試題分類。例如,專家小組可將試題分類,或是判斷測驗編製者的單元劃分是否合適。挑選專家小組成員和確定程序要非常謹慎,因為兩者都將影響分類的準確性。
標準 3.8
在進行試題預試(item try out)時,挑選參加預測的受測樣本的步驟,和終極樣本的特性都應作成書面說明。
在分派樣本時,應儘量使參加預試的對象能夠充分代表各個次群體。
說明:導致預試樣本相對於其整個預期群體,在解題時可能出現的些微差異狀況,應該適時作成書面說明。比如說,當接受預試的受測者知道他預試的分數對他沒有任何利害關係時,他們的做答動機就不會像正式受測者那麼高。
測驗編製步驟(4)及其對應的教育與心理測驗標準
4.編寫試題
標準 3.6
題型、作答方式、評分程序、和施測步驟等,都需要在測驗的目的、測量的內容範圍、和所針對的受測群體的基礎上進行選擇。
在可能程度內,所選擇的測驗內容應能保證對於不同次群體的受測者的分數的推論都具有同等效度。
測驗的審查過程應該包括實證數據資料分析。恰當的時候,還應邀請專家來審查試題和作答方式,而這些專家的資格、相關經歷以及人口統計學方面的特徵等資料也須要作成書面說明。
說明:專家可能做的工作有確認對參加測驗的次群體受測者可能不合適、不清楚或具有冒犯性的材料。例如,可能會請專家們確認,數學文字題裡缺少上下文對於有些學生來講是否會造成問題。
各種受測者次群體可按年齡、族裔、文化、性別、殘障類型、或人口統計學方面的地區分佈來劃分。但這種證據也是有限的,專家的審查可能會使施測中的不公平現象緩解一些。
標準 3.7
對於試題的研發、審查、預試(try out),以及從題庫裡選題的程序都必須作成書面說明。
如果根據測驗規格明細表(specification)將試題分類成幾個類別或分測驗時,分類的程序以及分類結果的適當性和正確性都須作成書面說明。
說明:在根據測驗規格明細表對試題進行分類時,可以使用實證證據(empirical evidence)和/或專家判斷(expert judgment)。例如,有時候會請專家小組將試題進行分類,或是判斷測驗編製者的分類架構是否合適。小組成員的資格和小組進行判斷所用的程序,都將影響分類的正確性。
標準 3.17
當已有的研究表明,與構念無關的變異量(irrelevant variance)可能會混淆測驗的內容領域的定義時,測驗編製者應該調查與構念無關變異量的來源。
只要可能,測驗編製者應該排除或減少這些無關變異量的來源。
標準 7.2
當研究報告表明不同的受測者次群體在某個測驗的某部分在構念無關變異量效應上不相等時,這測驗應該只用於那些有證據表明可以從測驗分數中獲取有效的推論的次群體。
說明:對於「某個測驗不適合某個次群體」的結論要有替換的解決辦法。這可能涉及到選擇一個適合所有次群體受測者的測驗,或是在使用不同的構念等同測驗有可能時,對這個現行測驗不能很好測量其構念的次群體受測者採用另一個測驗。
在有些情形下可能會把幾個測驗合起來用,使得其綜合分數在所有次群體中認證有效的推論成為可能。
在愗些情況下,諸如甄聘測驗,也有可能因法律或其他因素的約束而必須對不同次群體的受測者使用不同的測驗。
有時候,受測者請求使用的試卷版本並不是測驗編製者或使用者覺得最合適的版本。比如,一名殘障人士可能推辭替代性考卷而要求使用正常人用的標準考卷。在讓受測者完全清楚測驗本身如何使用及其結果之後,允許受測者這樣的要求並不算違反這條標準。
標準 13.18
透過多媒體或電腦進行施測與評分的測驗,需要將其設計、模式、計分演算法、以及評分和分類的方法等做成書面說明。
在測驗的設計和使用過程中,需要考慮那些因為使用電腦或其他媒體施測所引起的與構念無關的變異量(construct-irrelevant variance)來源,如受測者對科技和測驗形式的熟悉程度。
說明:在做書面說明時,注意不要危及試題的保密性,不要因此而對測驗分數解釋的效度造成負面影響。
在技術質量要求方面,電腦化或多媒體形式的測驗,與其他形式的測驗要求是一樣的。
標準 3.6
題型、作答方式、評分程序、和施測步驟等,都需要在測驗的目的、測量的內容範圍、和所針對的受測群體的基礎上進行選擇。
在可能程度內,所選擇的測驗內容應能保證對於不同次群體的受測者的分數的推論都具有同等效度。
測驗的審查過程應該包括實證數據資料分析。恰當的時候,還應邀請專家來審查試題和作答方式,而這些專家的資格、相關經歷以及人口統計學方面的特徵等資料也須要作成書面說明。
說明:專家可能做的工作有確認對參加測驗的次群體受測者可能不合適、不清楚或具有冒犯性的材料。例如,可能會請專家們確認,數學文字題裡缺少上下文對於有些學生來講是否會造成問題。
各種受測者次群體可按年齡、族裔、文化、性別、殘障類型、或人口統計學方面的地區分佈來劃分。但這種證據也是有限的,專家的審查可能會使施測中的不公平現象緩解一些。
標準 3.7
對於試題的研發、審查、預試(try out),以及從題庫裡選題的程序都必須作成書面說明。
如果根據測驗規格明細表(specification)將試題分類成幾個類別或分測驗時,分類的程序以及分類結果的適當性和正確性都須作成書面說明。
說明:在根據測驗規格明細表對試題進行分類時,可以使用實證證據(empirical evidence)和/或專家判斷(expert judgment)。例如,有時候會請專家小組將試題進行分類,或是判斷測驗編製者的分類架構是否合適。小組成員的資格和小組進行判斷所用的程序,都將影響分類的正確性。
標準 3.17
當已有的研究表明,與構念無關的變異量(irrelevant variance)可能會混淆測驗的內容領域的定義時,測驗編製者應該調查與構念無關變異量的來源。
只要可能,測驗編製者應該排除或減少這些無關變異量的來源。
標準 7.2
當研究報告表明不同的受測者次群體在某個測驗的某部分在構念無關變異量效應上不相等時,這測驗應該只用於那些有證據表明可以從測驗分數中獲取有效的推論的次群體。
說明:對於「某個測驗不適合某個次群體」的結論要有替換的解決辦法。這可能涉及到選擇一個適合所有次群體受測者的測驗,或是在使用不同的構念等同測驗有可能時,對這個現行測驗不能很好測量其構念的次群體受測者採用另一個測驗。
在有些情形下可能會把幾個測驗合起來用,使得其綜合分數在所有次群體中認證有效的推論成為可能。
在愗些情況下,諸如甄聘測驗,也有可能因法律或其他因素的約束而必須對不同次群體的受測者使用不同的測驗。
有時候,受測者請求使用的試卷版本並不是測驗編製者或使用者覺得最合適的版本。比如,一名殘障人士可能推辭替代性考卷而要求使用正常人用的標準考卷。在讓受測者完全清楚測驗本身如何使用及其結果之後,允許受測者這樣的要求並不算違反這條標準。
標準 13.18
透過多媒體或電腦進行施測與評分的測驗,需要將其設計、模式、計分演算法、以及評分和分類的方法等做成書面說明。
在測驗的設計和使用過程中,需要考慮那些因為使用電腦或其他媒體施測所引起的與構念無關的變異量(construct-irrelevant variance)來源,如受測者對科技和測驗形式的熟悉程度。
說明:在做書面說明時,注意不要危及試題的保密性,不要因此而對測驗分數解釋的效度造成負面影響。
在技術質量要求方面,電腦化或多媒體形式的測驗,與其他形式的測驗要求是一樣的。
2011年9月26日 星期一
測驗編製步驟(1)及其對應的教育與心理測驗標準
1.測驗編製計畫
標準1.1
應該呈現對於測驗分數的每一建議的解釋和用途的理論根據,並且附上該用法或解釋的證據和理論的綜合性摘要。
說明:理論根據應指明研究所建議解釋需要什麼樣的前提條件。
綜述應結合邏輯分析和實證證據對測驗的理論提出證據。
證據可取自測驗將要使用的情境的區域性的研究;也可取自前人的研究;或取自現有的研究結果的全面統計綜合,而這些結果已明顯達到效標。
沒有一種類型的證據天生就比別的證據更可取,而是證據的品質和它對預期用途的關連性決定了該種證據的價值。
對任何一點的實證證據的敘述在科學文獻理應對所有的有關發現都給予應有的份量,甚至包括和預期解釋或用途不一致的結果。
測驗編製者有責任對自己提出的建議提出支持性的證據,但測驗使用者有責任評鑑所提供的效度證據的品質,和它與本地情況的關連性。
標準 3.2
測驗目的(purposes)、內容領域(domain)的定義、和測驗規格明細表(specifications)應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。
說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。
內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,而哪些是被排除的。
清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。
標準 3.9
當測驗編製者在評鑑試題的心理計量特性時,應以書面說明其使用的是古典理論模式或是試題反應理論模式(IRT)。對於用來作試題分析的樣本應有詳盡的描述,而且樣本的大小和多樣性應該與試題分析方法相配合。
選題的過程和用來作選題的數據資料(如試題難易度、試題鑑別度和(或)試題訊息度等),也都應作成書面說明。
若是用試題反應理論模式來估計編製中測驗的試題參數的話,那試題反應模式、估算步驟、以及模式的適配性(model fit)的證據,都應該做成書面說明。
說明: 雖然整個樣本的大小很重要,但在對於試題的心理計量上特性有決定作用的地區,抽取恰當數量的樣本也同樣重要。如果這個測驗期望在分數軸上的特定區域達到最精確的估算值,且這種考慮影響到試題的選擇時,試題統計參數使用的方法需要仔細說明。
當以試題反應理論(IRT)作為測驗編製的理論基礎時,要記錄下採用的模式和數據資料間的適配程度的數值就非常重要。這一點可以通過檢查試題反應理論的假設條件的滿足程度來完成(比如﹕單維性、試題局部獨立性、或試題斜率參數)。
測驗編製者應該證明,試用版測驗和正式測驗的實施條件之間如有任何差異都不應影響試題發揮。
會影響試題統計參數的條件包括:試題在測驗中的位置、測驗時間限制、測驗題數、測驗方式(如:紙筆測驗還是電腦輔助性的測驗)、計算器或其他工具的使用。例如,在檢驗試題時,把某一試題放在試卷末尾時所得到的統計參數,就可能會比把它放在試卷中間時還要差。
標準1.1
應該呈現對於測驗分數的每一建議的解釋和用途的理論根據,並且附上該用法或解釋的證據和理論的綜合性摘要。
說明:理論根據應指明研究所建議解釋需要什麼樣的前提條件。
綜述應結合邏輯分析和實證證據對測驗的理論提出證據。
證據可取自測驗將要使用的情境的區域性的研究;也可取自前人的研究;或取自現有的研究結果的全面統計綜合,而這些結果已明顯達到效標。
沒有一種類型的證據天生就比別的證據更可取,而是證據的品質和它對預期用途的關連性決定了該種證據的價值。
對任何一點的實證證據的敘述在科學文獻理應對所有的有關發現都給予應有的份量,甚至包括和預期解釋或用途不一致的結果。
測驗編製者有責任對自己提出的建議提出支持性的證據,但測驗使用者有責任評鑑所提供的效度證據的品質,和它與本地情況的關連性。
標準 3.2
測驗目的(purposes)、內容領域(domain)的定義、和測驗規格明細表(specifications)應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。
說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。
內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,而哪些是被排除的。
清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。
標準 3.9
當測驗編製者在評鑑試題的心理計量特性時,應以書面說明其使用的是古典理論模式或是試題反應理論模式(IRT)。對於用來作試題分析的樣本應有詳盡的描述,而且樣本的大小和多樣性應該與試題分析方法相配合。
選題的過程和用來作選題的數據資料(如試題難易度、試題鑑別度和(或)試題訊息度等),也都應作成書面說明。
若是用試題反應理論模式來估計編製中測驗的試題參數的話,那試題反應模式、估算步驟、以及模式的適配性(model fit)的證據,都應該做成書面說明。
說明: 雖然整個樣本的大小很重要,但在對於試題的心理計量上特性有決定作用的地區,抽取恰當數量的樣本也同樣重要。如果這個測驗期望在分數軸上的特定區域達到最精確的估算值,且這種考慮影響到試題的選擇時,試題統計參數使用的方法需要仔細說明。
當以試題反應理論(IRT)作為測驗編製的理論基礎時,要記錄下採用的模式和數據資料間的適配程度的數值就非常重要。這一點可以通過檢查試題反應理論的假設條件的滿足程度來完成(比如﹕單維性、試題局部獨立性、或試題斜率參數)。
測驗編製者應該證明,試用版測驗和正式測驗的實施條件之間如有任何差異都不應影響試題發揮。
會影響試題統計參數的條件包括:試題在測驗中的位置、測驗時間限制、測驗題數、測驗方式(如:紙筆測驗還是電腦輔助性的測驗)、計算器或其他工具的使用。例如,在檢驗試題時,把某一試題放在試卷末尾時所得到的統計參數,就可能會比把它放在試卷中間時還要差。
測驗編製步驟(2)及其對應的教育與心理測驗標準
2. 界定試題內容取樣範圍
標準1.6
當以測驗內容的適當性作為效度驗證(validation)的一部分時,應該測驗所測量的構念或所代表的學科領域,對於確定和編寫測驗內容的步驟加以說明並提出充分理由。
如果界定的內容是結合重要性、出現頻率、或關鍵性等規準(criteria)來抽樣時,也應該對這些規準作出清楚的解釋並提出充分理由。
說明:例如,測驗編製者可能提供一個邏輯架構,排列出試題在學科領域的分佈,表明每道題目的相關性,和整套題目及與之代表的學科領域的符合性。學科領域裡沒有包括在測驗裡的部分最好也加以說明。
標準 3.2
測驗目的、內容領域的定義、和測驗內容細則應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。
說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。
內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,哪些又不包括在測驗內。清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。
標準 3.11
測驗編製者應將測驗內容所代表的領域和測驗規格明細表都作成書面說明,以利於作出有效的分數解釋。
說明:測驗編製者必須提供試題和評分規程代表限定內容領域的程度的證據,這樣有助於確定測驗分數是否能夠概推到所評量的內容領域。這一點對於只有少量試題的實作評量特別重要。這類證據可經由專家仲裁來提供
標準 14.8
基於測驗內容的效度證據要求對於有關的內容領域有透徹和清晰的界定。
對於用於選拔、分類和晉陞的測驗,對內容領域的特徵描述需要根據工作分析(job analysis)。
說明:一般說來,應該根據工作任務、工作人員的知識、技能、能力和其他人格特徵等方面來描述工作內容領域。這些特點應該具有清晰的量化定義,以便與測驗內容相連接。同時,這些工作要求在一段時間內不會出現明顯的變化。
這些包括在內容領域裡的知識、技能、和能力,也應該是那些工作應徵者在被僱用時應該擁有的。
標準1.6
當以測驗內容的適當性作為效度驗證(validation)的一部分時,應該測驗所測量的構念或所代表的學科領域,對於確定和編寫測驗內容的步驟加以說明並提出充分理由。
如果界定的內容是結合重要性、出現頻率、或關鍵性等規準(criteria)來抽樣時,也應該對這些規準作出清楚的解釋並提出充分理由。
說明:例如,測驗編製者可能提供一個邏輯架構,排列出試題在學科領域的分佈,表明每道題目的相關性,和整套題目及與之代表的學科領域的符合性。學科領域裡沒有包括在測驗裡的部分最好也加以說明。
標準 3.2
測驗目的、內容領域的定義、和測驗內容細則應該講得非常清楚,這樣人們才能夠判斷所定義的內容範圍對於測驗的目的是否合適,試題之間的關係對於它們試圖代表的範疇內各方面的知識點是否相吻合。
說明:測驗分數解釋的合適性和合用性依賴於測驗目的和測驗所要代表的內容領域在定義和闡述上的嚴密性。
內容領域定義應該充分、詳盡、準確地表明有哪些方面的知識、技能、過程、態度、價值、情緒或行為是包括在測驗中,哪些又不包括在測驗內。清楚的描述將有助於審查人員和其他有關人員對於已經定義的內容領域和測驗題目之間的一致性作出正確的判斷。
標準 3.11
測驗編製者應將測驗內容所代表的領域和測驗規格明細表都作成書面說明,以利於作出有效的分數解釋。
說明:測驗編製者必須提供試題和評分規程代表限定內容領域的程度的證據,這樣有助於確定測驗分數是否能夠概推到所評量的內容領域。這一點對於只有少量試題的實作評量特別重要。這類證據可經由專家仲裁來提供
標準 14.8
基於測驗內容的效度證據要求對於有關的內容領域有透徹和清晰的界定。
對於用於選拔、分類和晉陞的測驗,對內容領域的特徵描述需要根據工作分析(job analysis)。
說明:一般說來,應該根據工作任務、工作人員的知識、技能、能力和其他人格特徵等方面來描述工作內容領域。這些特點應該具有清晰的量化定義,以便與測驗內容相連接。同時,這些工作要求在一段時間內不會出現明顯的變化。
這些包括在內容領域裡的知識、技能、和能力,也應該是那些工作應徵者在被僱用時應該擁有的。
測驗編製步驟(3)及其對應的教育與心理測驗標準
3. 編寫測驗規格明細表
標準 3.3
測驗規格明細表(test specification)及其研發的理論依據和過程應該作成書面說明。
測驗規格明細表應對測驗內容、建議的試題數目、題型、試題的心理計量特性上的要求、以及各部分試題的安排等作出界定。
測驗規格明細表中還需要說明測驗的時間限制、對受測者的指示、施測和評分的步驟,以及其他有關事項。
說明:專業判斷在測驗規格明細表的製訂中扮演重要角色。
製訂規格明細表的具體步驟要根據測驗目的而定。
例如,在編製授與執照或證書的測驗時,對實際開業人員知識能力的分析和工作內容的分析,常為界定測驗規格明細表的範圍提供了實務的基礎。
而工作內容分析也為僱用測驗提供了基礎。
對於一門課結束時的學業成就測驗而言,測驗的規格明細表須要以課程內容大綱和教學目標為準。
但對安置測驗(placement test)來說,可能有必要審視好幾門課程在起步時所需要的知識和技能。
標準 3.4
解釋測驗分數的程序必須作成書面說明。合適時,建立常模的或標準化的樣本,以及所使用的效標的詳細說明也須作成書面說明。
說明:測驗規格明細表可以註明測驗分數的解釋是相對的還是絕對的,或是兩者兼而有之。
在相對分數解釋(常模參照式測驗)情形下,一個人(或一群人)的位置是由這個人的分數(或次群體的平均分數)相對於他所比較的一個或多個事先劃定的次群體而定的。
在絕對分數解釋(標準參照式測驗)情況下,分數(或平均數)被認為是直接反映受測者(或受測者次群體)在某個已經定義的效標領域的能力或精熟水準。
針對一種解釋而設計的測驗,對於另一種解釋,可能效果不是那麼好。但是,如果試題選擇完全吻合領域的界定,且如果可以衍生出一無可非議的標線標準的話,常模參照測驗裡得出的分數,也有可能做出有效的絕對分數解釋。
反之亦然,標準參照測驗裡產生的絕對分數也可能做出合理的相對分數解釋。但是設計來測量某一水準的精熟測驗(Mastery Tests),可能無法提供足夠的變異性來讓這些受測者做出正確且精細的排序,因此難以建立合理的常模。
標準 3.3
測驗規格明細表(test specification)及其研發的理論依據和過程應該作成書面說明。
測驗規格明細表應對測驗內容、建議的試題數目、題型、試題的心理計量特性上的要求、以及各部分試題的安排等作出界定。
測驗規格明細表中還需要說明測驗的時間限制、對受測者的指示、施測和評分的步驟,以及其他有關事項。
說明:專業判斷在測驗規格明細表的製訂中扮演重要角色。
製訂規格明細表的具體步驟要根據測驗目的而定。
例如,在編製授與執照或證書的測驗時,對實際開業人員知識能力的分析和工作內容的分析,常為界定測驗規格明細表的範圍提供了實務的基礎。
而工作內容分析也為僱用測驗提供了基礎。
對於一門課結束時的學業成就測驗而言,測驗的規格明細表須要以課程內容大綱和教學目標為準。
但對安置測驗(placement test)來說,可能有必要審視好幾門課程在起步時所需要的知識和技能。
標準 3.4
解釋測驗分數的程序必須作成書面說明。合適時,建立常模的或標準化的樣本,以及所使用的效標的詳細說明也須作成書面說明。
說明:測驗規格明細表可以註明測驗分數的解釋是相對的還是絕對的,或是兩者兼而有之。
在相對分數解釋(常模參照式測驗)情形下,一個人(或一群人)的位置是由這個人的分數(或次群體的平均分數)相對於他所比較的一個或多個事先劃定的次群體而定的。
在絕對分數解釋(標準參照式測驗)情況下,分數(或平均數)被認為是直接反映受測者(或受測者次群體)在某個已經定義的效標領域的能力或精熟水準。
針對一種解釋而設計的測驗,對於另一種解釋,可能效果不是那麼好。但是,如果試題選擇完全吻合領域的界定,且如果可以衍生出一無可非議的標線標準的話,常模參照測驗裡得出的分數,也有可能做出有效的絕對分數解釋。
反之亦然,標準參照測驗裡產生的絕對分數也可能做出合理的相對分數解釋。但是設計來測量某一水準的精熟測驗(Mastery Tests),可能無法提供足夠的變異性來讓這些受測者做出正確且精細的排序,因此難以建立合理的常模。
2011年8月11日 星期四
社會計量技術
社會計量技術
社會計量(sociometric)技術是一種用來觀察、測量、和改變社會互動的方法,其主要探討目標是一個指定的社會系統中的各種角色關係和功能,而要改變人的行為是要在這系統中重新建構其角色和功能。社會計量法假定在結構與功能之間有直接關係。
因此強調每個人所知覺的地位、作了什麼、以及人們對它覺得怎樣。它的目標是要揭露重複互相作了什麼,是由誰、對誰、以及如何,而且還要揭露這行動的目的、意義、和影響。由於焦點是放在重複的行為模式,行為是任何科學中可觀察、可測量、和可預測的主要元素。
社會計量法可以被看做是一種技術或一種測量方法。為了達到能夠被用來繪製圖表和鑑別的層次,社會計量法必須要符合科學家對於測量工具的要求:例如獨立觀察者之間的一致性、內部一致性、相似性(指如果沒有經過治療處理,在可見的未來會發生同樣的結果)以及對於反映出的家庭關係賦予意義時的區辨力。
當社會計量法被用來改變社會互動時,它就成為一種技術。社會計量技術之所以非常適用於夫妻和家族治療中,是因為它們在描述每一個人在系統中的地位、成員的互動形式、和他們對它的感覺上,是生動且很有效率的。
在歷史上,摩瑞諾(Moreno)和其追隨者曾引進社會計量技術給心理健康臨床醫師,特別是許多和心理劇(psychodrama)、社會劇(sociodrama)和雕塑(sculpting)有關的技術。在他們之後,社會心理學家和臨床醫師也引進了許多新技術,下面是一些例子:
- 社會關係圖(Sociogram)----一種將角色關係中的偏好和選擇繪製成圖表的方法。
- 家族關係圖(Genogram) ----一種將家族成員的關係和順序繪製成圖表的方法。
- 生態地圖(Ecomap) ---- 一種將這一家庭在大家族和社區中的地位、運作於它的影響力、和可用的資源都繪製成圖表的方法。
- 家庭平面圖(Family Floor Plan) -----一種將空間、地方、和情緒繪製成圖表的方法。
- 雕塑技巧(Sculpting) ----一種擺佈各個成員的身體,以用來表現出他們在一特定情境或理想上的關係的方法。
- 遊戲(Games)----藉著用積木建造塔或房子,或藉著完成智力競賽性遊戲或解決問題,來把象徵性地把角色行為付之行動。
- 角色卡遊戲(Role Card Game)----用來確認個人在家庭中所察覺的和期待的角色。
不同理論學派的擁護者使用社會計量法來獲得資料和與他們的理論一致的結果。
舉例來說,心理分析學家會獲得一些對於被認定的病人的影響力的資料,如: 社會影響、投射和認同模式、未完成事件或在原生家庭的心理創傷、挫折的昇華、因應與適應機轉、和對潛意識行為的線索。
溝通理論學家會找出溝通的路線和這系統內錯誤的溝通。他們的興趣在於決定誰是溝通的中心,以及誰是明星、孤立者、阻礙者、支持者、質問者、追隨者等等。
系統理論學家關心這一互動系統的模式和形成;它在權力和決策、界線、親近與疏遠、同盟、共謀、角色、規則、互補、與類似這些方面是如何被組織起來的。
治療師可以把這訊息回饋給案主以增加他們的覺察和頓悟。她可以經由直接行動、訓練、發問、解釋、或直接的指示來介入或重新塑造這一個建構。
社會計量法能提供許多好處:
1. 它們把治療從理智的或情緒的討論轉移到實驗性的具體行動。
這會增加每一成員的主動參與, 而它通常會對增加案主的自發性,和減少因智力競賽所引的抗拒有效果。
2. 它們把過去、現在、和預期的未來放進一個此時此地運作的架構。
我們可以回憶,但我們不能改變過去。我們可以期望,但我們不能活在未來。藉著把這些放在一個此時此地的經驗中,案主可以立即採取行動來改變知覺、理解、計畫或行為。
3. 它們包含了個人認同和投射的重要元素。
各種信仰、感覺、和態度在互動的脈絡中以行為表達出來,這樣它們成為外顯的和可用來檢驗和修改的。投射對於適時的描繪加入一性質上的轉向。(參見第二章序論,可知投射的優點和性質)
4. 它們把各種角色和角色知覺加以揭露和戲劇化。
成員們觀察每一角色在作什麼,它是如何被知覺的以及這角色是如何被增強的。
5. 它們與案主對於治療的期待有令人訝異的差異。
它們可能有助於避免可能遇到的抗拒。
6. 它們是有趣的。
這些技術可抓住案主的注意力。
7. 它們構成一種後設溝通(meta communication)的形式。
現實和神話被合併在一起而新的訊息,而新的訊息被系統的闡述;發送、和接收。舉例來說,當一個家庭被雕塑,而父親是被放在家庭的圓圈外面,背向著家庭,這個事件對丈夫、妻子、孩子、和整個家庭都透露了多有用的訊息。
8. 它們把注意力集中在社會單位和社會互動歷程。
當這家庭注意到他們的相互的行為和地位時,「病人」或被認為的案主的孤立和疏離的感覺也會被質疑。很清楚地,一個人是不可能領導的,若另外一個無法追隨;一個人不可能如此無助並存活下來,如果另一個人不接管並為他做事。這類因素如親密、各憋性、親近、疏遠的調節、和衝突管理技巧都被注意到。
訂閱:
文章 (Atom)