Badanie ujawniło, że 4-bitowa kwantyzacja wag w modelach Gemma 4 i Qwen 3.5 powoduje zupełnie różne problemy w zależności od języka, czego dotychczasowe ewaluacje skoncentrowane na angielszczyźnie nie uchwycały. Przeprowadzając testy na ośmiu językach przy użyciu benchmarków MMLU ProX Lite i GlobalPIQA, naukowcy odkryli cztery kluczowe zjawiska. Po pierwsze, języki niskoResourceowe i te z pismem nie-łacińskim ulegają reprezentacyjnemu kolapsu - model po prostu nie potrafi generować poprawnych logitów dla zadań. Po drugie, wbrew intuicji, wcześniejsze pretreniowanie nie chroni dobrze przed utratą precyzji. Po trzecie, routing wieloetapowy między językami się degraduje, ale asocjacyjne wspomnienia z dziedzin soft-science pozostają stabilne.
Oprócz problemów, badacze zaobserwowali także fenomen odporności na kwantyzację - pewne domeny o wysokim nasyceniu i typologicznym dopasowaniu opierają się degradacji, a ich wydajność po kwantyzacji zmienia się jedynie w granicach szumu statystycznego. Te odkrycia mają znaczenie dla każdego, kto chce wdrażać małe modele językowe na urządzeniach brzegowych w środowiskach wielojęzycznych. Pokazują, że obecne strategie optymalizacji dla edge deviceów mogą nieświadomie marginalizować mniejszości językowe, zaś ewaluacja wydajności modeli musi być znacznie bardziej zróżnicowana geograficznie i typologicznie.