Zespół badawczy opracował UserToolBench, benchmark specjalizowany w ewaluacji zdolności modeli LLM do podejmowania decyzji personalizowanych dla użytkowników. W przeciwieństwie do istniejących testów skupiających się na recall profilów użytkownika czy ogólnym użyciu narzędzi, UserToolBench weryfikuje czy modele potrafią wnioskować utajone preferencje z historii interakcji, rozpoznawać kiedy potrzebne jest wyjaśnienie, i generować sekwencje decyzji narzędziowych dostosowane do użytkownika w warunkach niekompletnej informacji.
Benchmark został zbudowany na podstawie opatrzennych w privacy-preserving rzeczywistych śladów interakcji. Zawiera 10 spersonalizowanych profili użytkowników, 36 zestawów narzędzi, 170 unikalnych narzędzi i 1065 tur rozmów rozciągających się na wiele-turowe dialogi. Obejmuje trzy główne kategorie zadań: scenariusze z brakiem informacji, pojedyncze narzędzie oraz wiele narzędzi do współkoordynacji.
Experimenty z mocnymi modelami tool-use LLM pokazały że aktualne systemy borykają się z personalizowaną delegacją zadań. Koordynacja wielu narzędzi, wnioskowanie brakujących ograniczeń i spójność zachowania na długich horyzontach pozostają głównymi wąskimi gardłami. Badanie sugeruje że ewaluacja personalizacji powinna przesunąć się od pytania czy wyjście brzmi użytkownik-specyficzne w kierunku oceny czy LLM podejmują faktycznie poprawne decyzje dla reprezentowanych użytkowników.