Naukowcy z pracowni sztucznej inteligencji opracowali CHORUS, nowy framework post-trainingu dla modeli językowych ukierunkowany na generowanie testów weryfikacyjnych chipów. Zamiast tradycyjnego podejścia supervised fine-tuning (SFT) uzupełnionego reinforcement learningiem (RL), CHORUS wykorzystuje kombinację tych metod w inny sposób - najpierw tworzy behawioralnie zróżnicowane modele przez fazowy SFT, a następnie RL przekształca je w silnych ekspertów o różnych punktach mocnych.
Kluczowa innowacja polega na spostrzeżeniu, że powstałe specjalistyczne modele mają komplementarne mocne i słabe strony. Framework łączy je przez beztreniingowe mergowanie modeli lub dalszy post-training, osiągając wyniki lepsze niż każdy pojedynczy expert. Konsolidując tych specjalistów w jeden model 4B, CHORUS uzyskał 88,0% Pass@1 na benchmarku CVDP-ECov, wyprzedzając znacznie większy DeepSeek-R1 (671B parametrów) o 13,5 punktu procentowego.
Wynik ma praktyczne znaczenie dla branży półprzewodników, gdzie weryfikacja sprzętu stanowi znaczną część wysiłku projektowego chipów. Efektywne generowanie testów z wysokim pokryciem jest kluczową częścią tego procesu, a mniejszy model o lepszych wynikach oznacza większą dostępność i niższe koszty obliczeniowe dla firm projektujących procesory.