Sakana AI przedstawił system Multi-Layered Review (MLR), który wykorzystując agentów AI do recenzji prac naukowych osiąga 73,43% dokładności w wykrywaniu błędów w głównych twierdzeniach artykułów. W odróżnieniu od poprzednich podejść oceniających AI recenzentów na podstawie podobieństwa do opinii człowieka, Sakana AI skupia się na faktycznym zdaniu znaleźć pomyłki i sprzeczności.

System testowano na 1164 błędach specjalnie wstawionych w 257 artykułach z 5 różnych konferencji naukowych. MLR czyta do 10 stron tekstu głównego i korzysta z trzech agentów: Appendix Agent (Claude Haiku 3.5) podsumowuje eksperymenty i szczegóły implementacji, Literature Review Agent (Claude Sonnet 4) przeszukuje web w poszukiwaniu powiązań z wcześniejszymi badaniami. Cały system pracuje na tanich modelach API bez potrzeby dostępu do GPU czy fine-tuningu, kosztując około 0,47 dolara za recenzję.

Choć wyniki są obiecujące, system ma istotne ograniczenia. Przy testowaniu na rzeczywistych wycofanych artykułach z arXiv osiągnął zaledwie 16,11% dokładności w dokładnym dopasowaniu, a system jest podatny na ataki poprzez prompt injection. Dla deweloperów budujących agenty badawcze wyciąga się praktyczną lekcję - zarówno projekt systemu jak i wybór modelu są kluczowe dla efektywnego wykrywania błędów.