
Como o Saeb aloca questões na escala de proficiência - e o que a posição de cada item realmente significa
Entenda como a TRI posiciona questões na escala de proficiência do Saeb e por que essa posição vai muito além do percentual de acertos.
O Saeb posiciona as questões em uma escala de proficiência a partir de seu comportamento psicométrico: em termos práticos, a posição de um item indica a região da escala em que aumenta a probabilidade de estudantes conseguirem respondê-lo corretamente. Por isso, uma questão não ocupa determinado nível simplesmente porque foi acertada por uma determinada porcentagem dos alunos.
Essa diferença é fundamental para compreender a lógica do Saeb. A escala organiza, de um lado, estudantes do menor para o maior desempenho, ao mesmo tempo em que permite colocar, em uma mesma métrica, a proficiência dos participantes e as características dos itens utilizados para medi-la.
É justamente essa relação que possibilita transformar uma pontuação, como 200, 250 ou 300 pontos, em uma informação pedagogicamente interpretável sobre aquilo que determinado grupo de estudantes provavelmente consegue fazer.
A posição de uma questão na escala não é definida apenas pelo percentual de acerto
Imagine duas questões de Matemática respondidas corretamente por 40% dos estudantes de duas aplicações diferentes.
O percentual é igual. Isso significa que elas têm exatamente a mesma dificuldade?
Não necessariamente.
O percentual de acerto depende não apenas da questão, mas também de quem respondeu à prova. Uma questão aplicada predominantemente a estudantes com maior proficiência pode apresentar uma taxa de acerto diferente daquela que apresentaria diante de um grupo com menor proficiência.
É uma das razões pelas quais avaliações como o Saeb utilizam a Teoria de Resposta ao Item (TRI).
O Inep adotou a TRI no Saeb em 1995, permitindo, entre outros aspectos, a construção de escalas que possibilitam acompanhar resultados ao longo do tempo. Nesse modelo, interessa compreender a relação entre a proficiência do estudante e a probabilidade de responder corretamente a cada item.
Para isso, os itens precisam passar por análises psicométricas que permitam conhecer suas características. Em modelos de TRI utilizados em avaliações educacionais, três parâmetros são particularmente importantes:
- dificuldade: indica a localização do item na escala de proficiência; - discriminação: mostra quanto aquele item consegue diferenciar estudantes que se encontram em regiões próximas da escala; - acerto casual: considera a possibilidade de estudantes com baixa proficiência acertarem a questão sem necessariamente dominarem a habilidade avaliada.
Esses parâmetros são estimados a partir do comportamento real dos itens. É por isso que a qualidade de uma avaliação baseada em TRI começa muito antes do cálculo da proficiência: depende de questões que tenham sido elaboradas, testadas e analisadas adequadamente.
No artigo Pré-testagem de questões: o que é e por que faz diferença no resultado do seu aluno, explicamos justamente como a aplicação experimental permite verificar dificuldade, discriminação, funcionamento das alternativas e outros aspectos antes que um item seja utilizado para produzir um diagnóstico educacional.
Então o que significa dizer que um item está em determinado ponto da escala?
Significa estabelecer uma relação probabilística entre o item e a proficiência necessária para respondê-lo.
O próprio Inep descreve as escalas do Saeb como réguas construídas a partir dos parâmetros dos itens. Segundo o instituto, a posição ocupada por uma questão funciona como uma possível linha divisória: estudantes com proficiência acima daquela posição apresentam maior probabilidade de acertá-la, enquanto aqueles abaixo apresentam menor probabilidade.
A palavra importante aqui é probabilidade.
Um estudante posicionado acima de determinado item não necessariamente irá acertá-lo. Da mesma forma, estar abaixo dele não torna o acerto impossível.
Isso acontece porque proficiência não determina individualmente cada resposta. Outros fatores podem interferir: um estudante pode cometer um erro de atenção em uma questão relativamente fácil ou chegar à resposta correta de uma questão difícil sem dominar completamente a habilidade avaliada.
A TRI considera justamente os padrões de resposta para produzir uma estimativa mais robusta da proficiência.
Como os itens ajudam a transformar pontos da escala em habilidades
Saber que os estudantes de uma escola estão distribuídos em diferentes faixas de proficiência ainda deixa uma pergunta importante: o que esse número significa pedagogicamente?
É aqui que a relação entre itens e escala ganha outra função.
O Inep organiza os resultados do Saeb em escalas de desempenho cujos níveis descrevem competências e habilidades demonstradas pelos estudantes. A escala é cumulativa: avançar ao longo dela está associado à incorporação de habilidades progressivamente mais complexas.
Para construir essa interpretação, é necessário observar quais itens estão associados às diferentes regiões da escala e analisar pedagogicamente o que eles exigem do estudante.
A lógica, portanto, parte da medida para a interpretação:
respostas dos estudantes → análise psicométrica dos itens → escala de proficiência → análise pedagógica dos itens → descrição das habilidades associadas às diferentes regiões da escala.
É essa combinação entre evidência estatística e análise pedagógica que dá significado aos números.
Por isso, a matriz de referência e a escala também cumprem funções diferentes. A matriz estabelece quais competências e habilidades serão objeto da avaliação; a escala ajuda a interpretar como essas aprendizagens aparecem nos resultados. O próprio Inep ressalta que as matrizes orientam a construção dos itens e representam um recorte das aprendizagens que podem ser avaliadas.
Explicamos essa primeira parte do processo em Como o Enem e o Saeb avaliam as áreas do conhecimento: matrizes de referência em foco.
O que essa lógica muda na interpretação dos resultados pela escola?
Compreender como os itens se relacionam com a escala muda uma pergunta aparentemente simples.
Em vez de perguntar apenas:
“Quantas questões nossos estudantes acertaram?”
uma avaliação baseada em escala permite investigar:
“Que nível de proficiência as respostas desses estudantes permitem estimar e quais aprendizagens estão associadas a essa região da escala?”
As duas perguntas não são equivalentes.
Uma prova convencional pode informar que um estudante acertou 18 de 30 questões. O dado descreve seu desempenho naquele conjunto específico de itens.
Uma medida de proficiência pretende ir além: localizar o desempenho em uma referência que tenha significado independentemente daquela prova específica e, quando existem condições técnicas para isso, permitir comparações entre diferentes aplicações.
É por isso que o Saeb pode utilizar diferentes cadernos de prova. O próprio Inep informa que dois estudantes não necessariamente respondem às mesmas questões. Ainda assim, os resultados podem ser produzidos em uma escala comum.
Essa característica também ajuda a compreender por que fazer uma prova com questões simplesmente “parecidas com as do Saeb” não significa produzir resultados comparáveis ao Saeb.
Para isso, é necessário que exista uma ligação estatística com a escala de referência. Em processos de equalização, itens com parâmetros previamente conhecidos podem funcionar como âncoras para posicionar os resultados de uma nova avaliação na mesma métrica. Documentação técnica recente do Inep, por exemplo, descreve o uso de itens comuns previamente calibrados como condição para posicionar resultados na escala de referência utilizada na avaliação da alfabetização.
Esse é um ponto especialmente importante para escolas e redes que utilizam simulados.
Uma avaliação pode estar perfeitamente alinhada à matriz do Saeb e conter questões pedagogicamente adequadas sem, por isso, produzir automaticamente uma proficiência na escala Saeb.
São requisitos diferentes.
Para produzir uma medida tecnicamente consistente, é preciso conhecer o comportamento dos itens, trabalhar com parâmetros psicométricos e estabelecer adequadamente a relação entre o instrumento aplicado e a escala em que os resultados serão apresentados.
É também por isso que, na TRIEduc, a construção de avaliações envolve banco de itens pré-testados e calibrados e análise pela TRI. O objetivo não é apenas entregar uma quantidade de acertos ao final da prova, mas produzir evidências que permitam compreender onde os estudantes se encontram em relação às aprendizagens avaliadas.
Como mostramos em Escala de proficiência: por que ela é mais importante que a nota média para decisões pedagógicas e de gestão educacional, a utilidade da escala aparece justamente quando o número deixa de ser apenas resultado e passa a ajudar a responder três perguntas: o que os estudantes provavelmente já conseguem fazer, onde estão suas principais dificuldades e qual é o próximo conjunto de aprendizagens que precisa ser desenvolvido.
Para uma escola ou rede, essa é a diferença entre receber uma pontuação e receber uma medida que possa efetivamente orientar decisões pedagógicas.
Se sua escola ou rede utiliza simulados Saeb e precisa transformar as respostas dos estudantes em diagnósticos tecnicamente consistentes de aprendizagem, converse com a equipe da TRIEduc sobre avaliações construídas com itens pré-testados, calibrados e analisados pela TRI.
Leia também
Escala de proficiência: por que ela é mais importante que a nota média para decisões pedagógicas e de gestão educacional
Entenda por que uma escala oferece informações que o percentual de acertos ou a média isolada não conseguem revelar e como interpretar diferentes regiões de proficiência.
Pré-testagem de questões: o que é e por que faz diferença no resultado do seu aluno
Veja como questões são testadas empiricamente antes de integrar uma avaliação e por que conhecer dificuldade, discriminação e outros parâmetros é essencial para produzir medidas confiáveis.
Diferença entre dificuldade e discriminação de itens: como avaliar
Aprofunde dois dos principais parâmetros utilizados para compreender o comportamento de uma questão e descubra por que uma questão difícil não é necessariamente uma boa questão.
Quando um teste mede bem e quando apenas gera números bonitos
Entenda quais características fazem com que os resultados de uma avaliação possam sustentar inferências sobre a aprendizagem — e por que relatórios, médias e gráficos não compensam um instrumento de medida frágil.
