СДЕЛАЙТЕ СВОИ УРОКИ ЕЩЁ ЭФФЕКТИВНЕЕ, А ЖИЗНЬ СВОБОДНЕЕ

Благодаря готовым учебным материалам для работы в классе и дистанционно

Скидки до 50 % на комплекты
только до

Готовые ключевые этапы урока всегда будут у вас под рукой

Организационный момент

Проверка знаний

Объяснение материала

Закрепление изученного

Итоги урока

Статья на тему: «Тесты и их использование в психолого-педагогической диагностике с проблемами умственного развития»

Нажмите, чтобы узнать подробности

Статья на тему: «Тесты и их использование в психолого-педагогической диагностике с проблемами умственного развития»

Просмотр содержимого документа
«Статья на тему: «Тесты и их использование в психолого-педагогической диагностике с проблемами умственного развития»»

Статья на тему: «Тесты и их использование в психолого-педагогической диагностике с проблемами умственного развития»

Достоинства метода тестов

Стандартизация условий и результатов. Тестовые методики относительно независимы от квалификации пользователя (исполнителя), для проведения тестов можно подготовить даже лаборанта со средним образованием.

Оперативность и экономичность. Типичный тест состоит из серии кратких заданий, на выполнение каждого из которых требуется, как правило, не более полуминуты, а весь тест занимает не более часа (в школьной практике это один урок); тестированию одновременно подвергается сразу группа испытуемых, таким образом, происходит значительная экономия времени (человеко-часов) на сбор данных.

Количественный дифференцированный характер оценки. Хороший тест позволяет различать не только три категории учеников - отличников, “середнячков” и “хвостистов”, но и хорошо дифференцировать испытуемых на полюсах шкалы - отличать просто способных от очень способных и талантливых, а среди отстающих отличать небезнадежных от безнадежных.

Оптимальная трудность и психологическая адекватность. Профессионально сделанный тест состоит из заданий оптимальной трудности. При этом средний испытуемый набирает примерно 50 процентов из максимально возможного количества баллов. Это достигается за счет предварительных испытаний – психометрического эксперимента. Свойство оптимальной сложности важно для теста тем, что оно обеспечивает не только измерительную силу тесту, но и оптимальный психологический настрой испытуемых. Тестовая ситуация оптимальной сложности является оптимальным возбудителем - люди испытывают нормальный уровень стресса (напряжения), необходимый для того, чтобы показать наивысший результат. Недостаток стресса (в случае легкого теста), а тем более избыток (в случае трудного) искажают результаты измерения.

Надежность и справедливость. Любой грамотно построенный тест охватывает основные разделы учебной программы (тестируемой области знаний или проявлений какого-то умения или способности). В результате возможность для “хвостиков” выбиться в отличники, а для отличника вдруг “провалиться” резко сокращается. То есть сокращается “лотерейный” характер экзаменов. Хороший тест ставит всех испытуемых в равные условия.

Возможность компьютеризации. Сокращается живой труд квалифицированных исполнителей при массовом обследовании, резко сокращается время тестирования, компьютеризация - это мощный инструмент обеспечения информационной безопасности, позволяет технически предотвратить злоупотребления со стороны недобросовестных экзаменаторов, выбор заданий может производить сама компьютерная программам.

Требования, предъявляемые к тестам


  • надежность,

  • валидность,

  • стандартизация.

Надежность теста — это характеристика точности его как измерительного инструмента, это помехоустойчивость теста, независимость его результатов от действия всевозможных случайных факторов. К числу таких факторов следует отнести:

- разнообразие внешних материальных условий тестирования, меняющихся от одного испытуемого к другому (время суток, освещенность, температура в помещении, наличие посторонних звуков, отвлекающих внимание и т.п.);

- динамичные внутренние факторы, по-разному действующие на разных испытуемых в ходе тестирования (время так называемой “вырабатываемости” - выхода на стабильные показатели темпа и точности действий после начала тестирования, скорость утомления и т.п.);

- информационно-социальные обстоятельства (различная динамика в установлении контакта с психологом или лаборантом, проводящим тестирование; возможное наличие других людей в помещении; наличие предыдущего опыта знакомства с данным тестом; наличие какого-то знания и отношения к тестам и т.п.).

Разнообразие и изменчивость всех этих факторов так велики, что они обусловливают появление у каждого испытуемого непрогнозируемого по размерам и направлению отклонения - измеренного тестового балла от истинного тестового балла (который можно было бы в принципе получать в идеальных условиях). Средняя относительная величина этого отклонения определяется как “стандартная ошибка измерения”. Величина ошибки измерения указывает на уровень неточности или ненадежности тестовой шкалы (специально подчеркнем, что в психометрической теории надежность и точность оказываются синонимами).

На практике оценка и места испытуемых в результате повторного тестирования часто меняются. Метод повторного тестирования является основным при определении надежности теста.

В переводе термин «валидность» означает обоснованность, достоверность.

Валидность теста — это соответствие получаемой информации измеряемому психическому свойству или процессу. Валидизация теста – это поиск ответа на вопрос, измеряет ли данная методика то, что, по замыслу автора, она должна измерять, и насколько точно она это делает. Это важнейшее психометрическое свойство теста.

Типы валидности:

  • содержательная - мера представленности в тесте всего объема измеряемой области психических свойств,

  • конструктивная – степень соотнесения результатов теста с базовыми для него теоретическими понятиями,

  • критериальная – соотношение результатов теста с результатами, полученными с помощью других методик (наблюдения, эксперимента и др.). Есть два вида:

а) текущая – когда результаты теста сопоставляются с данными из других источников, собираемых одновременно с тестированием;

б) прогностическая (предсказывающая) – когда результаты теста сопоставляются с более поздним поведением испытуемых в данной среде.

В современной психометрике разработаны буквально десятки разно-образных теоретических и экспериментальных методов проверки валидности тестов. Основным элементом практически всех этих методов является так называемый критерий валидности - это независимый от теста, внешний по отношению к тесту источник информации об измеряемом психическом свойстве. Мы не можем судить о валидности теста до тех пор, пока не сравним его результаты с источником истинной (или хотя бы заведомо более валидной) информации об измеряемом свойстве - с критерием.

Очень часто в качестве критерия валидности используется экспертная оценка. Например, мы хотим убедиться, что короткий тест на измерение уровня дисциплинированности валиден. Для этого опрашиваем учителей об уровне дисциплинированности хорошо известных им учеников. И после этого сравниваем (корреллируем) результаты теста и экспертный рейтинг учеников по дисциплинированности.

Выделенные по различным признакам типы и виды валидности должным образом не специфицированы и не соотнесены друг с другом. Какой-либо единой классификационной системы пока нет, и ее создание даже не ставится в повестку дня. В связи с этим и в практической сфере, т.е. в деле валидизации конкретных психологических тестов, существенного прогресса пока не достигнуто – почти все тесты, используемые в настоящее время в научных или практических целях, валидизированы лишь на уровне определения их ценности для конкретных практических целей или путем определения степени их корреляции с другими тестами.

Если мы с помощью соответствующей модели валидизации получим неубедительный результат (слишком низкий индекс валидности), это еще не означает, что тест невалиден. Причин этому может быть много. Например, тест валиден в совсем иной области, чем та, которую мы изучаем. Мы также могли допустить ошибку в подсчетах, либо применили линейные корреляции, в то время как отношение между тестом и критерием является нелинейным.

Помимо случайных факторов, на валидность теста влияют систематические факторы. Они привносят систематические искажения в результаты. Эти факторы есть другие психические свойства, которые мешают проявиться в результатах теста тому свойству, на которое тест направлен.

Например, мы хотим измерять “потенциал обучаемости” (важнейший компонент общих интеллектуальных способностей человека), но даем испытуемому тест с жестким ограничением времени исполнения и отсутствием возможности вернуться и исправить допущенную ошибку. Совершенно очевидно, что искомое психическое свойство оказывается смешанным в тесте с ложным психическим свойством - “стрессоустойчивость”: испытуемые с высокими показателями стрессоустойчивости будут лучше выполнять тест. В этом проявится эффект систематического искажения.

В последнее время указывается и на другой важный довод, который может способствовать в будущем пересмотру всех до сих пор существующих работ по валидизации. При прогностической валидизации теста способностей по отношению к успеху в будущем было обнаружено, что наивысшую валидность имели тесты у стабильных экстравертов, в то время как у лабильных экстравертов корреляция была около нуля. К переменным-модераторам вероятно принадлежит теоретически предполагаемая переменная, называемая предсказуемостью.

Особой разновидностью валидности является достоверность. Речь идет о сознательных или бессознательных искажениях, которые вносит в тестовые результаты сам испытуемый, руководствуясь в ходе теста особой мотивацией, отличающейся от той, которая присуща ему в реальном поведении. Способность теста защищать информацию от мотивационных искажений и есть достоверность теста.

Типичный прием обеспечения достоверности - наличие в тест-опросниках ШКАЛ ЛЖИ. Эти шкалы основываются главным образом на феномене социальной желательности - стремлении испытуемых давать в ходе тестирования социально одобряемую информацию.

Если испытуемый набрал по шкале лжи балл выше критического, то его протокол объявляется недостоверным и ему предлагается либо выполнить данный тест еще раз более откровенно, либо выполнить другой тест. Многие более специфичные “ловушки”, направленные на измерение достоверности, часто входят как компонент в структуру конкретного теста, а иногда даже не подлежат разглашению как элемент “ноу-хау” и профессиональной тайны.

Стандартизация – многократная проверка теста на большом количестве испытуемых. Выборка, на которой определяются статистические тестовые нормы, называется выборкой стандартизации. Ее численность, как правило, не меньше 200 человек. Столько людей должно принять участие в психометрическом эксперименте по определению тестовых норм - в эксперименте по стандартизации теста.

Стандартизация подразумевает единообразие процедуры проведения и оценки выполнения теста.

Другой важный этап в стандартизации теста – установление норм. Первоначальный суммарный балл, подсчитанный с помощью ключа, не является показателем, который можно диагностически интерпретировать. Его называют в тестологии “сырым тестовым баллом”. Применение тестовых норм в профессионально организованной психодиагностике основывается на переводе тестовых баллов из “сырой” шкалы в “стандартную”. Эта процедура называется “стандартизацией тестового балла”.

Обычно разработчики снабжают пользователей теста так называемой конверсионной таблицей для перевода сырых баллов в стандартные баллы по заданной шкале. В ней приводится полный перечень соответствий между интервалами сырой шкалы и стандартной.

После того, как балл по тесту стандартизирован, можно выносить диагностическое заключение. Общее правило здесь таково: если стандартный балл превышает единицу “верхней” (или “высокой”) группы, то данному испытуемому приписывается повышенное значение измеренного психического свойства; если же стандартный балл ниже границы “нижней” (“низкой”) группы, то о данном испытуемом формулируется заключение, соответствующее низкому полюсу измеряемого свойства; если стандартный тестовый балл Y заключен в пределах центрального интервала, то про испытуемого говорят, что у него измеренное свойство выражено в средней степени - как у большинства людей.

То, насколько выборка стандартизации позволяет применять тест на широкой популяции, называется репрезентативностью тестовых норм. Репрезентативность - важнейшее психометрическое свойство теста. Понимание смысла этого требования к тесту помогает правильно учитывать ограничения в сфере его применения.

Если тест повторно используется в условиях, которые существенно отличаются от тех, где он был первоначально создан, то почти всегда требуется соотнесение этих условий друг с другом или адаптация теста к новым условиям.

Например, если тест проходил стандартизацию на студентах, то перед его применением на школьниках следует вначале произвести рестандартизацию, то есть снова собрать тестовые нормы на представительной выборке, сформированной именно из школьников. В противном случае диагностические выводы, произведенные по неадекватным тестовым нормам, будут неточны и неверны.

Одно из требований - социокультурная адаптированность теста. Это словосочетание означает соответствие тестовых заданий и тестовых оценок, которые испытуемый получает по этим заданиям, особенностям культуры, сложившимся в том или ином обществе, где данный тест используется, будучи заимствованным в другой стране. Если, например, созданный в Европе тест интеллекта впервые применяется в стране, где доминирующим в структуре интеллекта является не словесно-логическое, а образное или практическое мышление, то он обязательно должен быть социокультурно адаптирован. В противном случае, применяя его в первоначальном, неадаптированном варианте, мы, скорее всего, получим низкие результаты, которые не будут соответствовать уровню развития мышления у жителей данной страны. И, наоборот, используя в качестве теста интеллекта такой, где преобладают задания на практическое мышление, в стране с доминированием вербального интеллекта, мы там можем получить неадекватные показатели умственного развития.

Кроме статистических тестовых норм в современных тестах часто используются критериальные нормы. Например, если оператор АЭС был точен в 45 из 48 процентов заданий, то это может еще и не соответствовать требуемому уровню критериальной “надежности оператора” (в данном случае “надежность” - измеряемое свойство), а вот если он был точен в 47 из 48 заданий, то это может считаться достаточным уровнем “надежности”. Таким образом, при построении диагностических заключений по критериальным тестам мы интересуемся не степенью отклонения балла от центра шкалы, а достижением или недостижением какого-то критического уровня на шкале.