Zespół naukowców opracował metodę wykorzystującą multimodalny model językowy Qwen 3.5 do dokładnego oszacowania parametrów trudności zadań testowych na podstawie przewidywanych przez model prawdopodobieństw wyboru poszczególnych odpowiedzi.
Model przeszkolono na rozbudowanym zbiorze zadań wielokrotnego wyboru łączących tekst i obrazy, a następnie dostrojono do replikowania wzorców błędów popełnianych przez uczniów o różnych poziomach umiejętności. Dzięki nauce na podstawie tego zróżnicowanego materiału model nauczył się niejawnie kodować prawdopodobieństwa odpowiedzi zawarte w modelach 3-parametrycznego logistycznego i wielokrotnego wyboru. To oznacza, że zamiast tradycyjnych, czasochłonnych testów empirycznych, model może bezpośrednio oszacować trudność zadania, analizując jedynie swoje przewidywane prawdopodobieństwa dla każdej opcji odpowiedzi.
Takie podejście otwiera nowe możliwości w psychometrii i edukacji. Nauczyciele i twórcy testów mogliby w przyszłości szybko weryfikować trudność nowych zadań bez konieczności przeprowadzania kosztownych badań na dużych próbach uczniów. Metoda łączy moce nowoczesnych modeli multimodalnych z klasyczną teorią testowania, stanowiąc potencjalnie znaczący krok w kierunku zautomatyzowania procesu ewaluacji materiałów edukacyjnych.