Xiaomi MiLM Plus wydała PROVE, system oceny jakości modeli usuwających obiekty z filmów wideo, który został zaakceptowany na konferencji ACM MM 2026. Problem, który rozwiązuje, jest fundamentalny: diffusion erasers i inne zaawansowane modele usuwania obiektów potrafią przekonująco rekonstruować cienie, odbicia i zasłonięte struktury, ale popularne metryki oceny jak PSNR, SSIM, LPIPS czy ReMOVE często oceniają ich wyniki błędnie. Dzieje się tak dlatego, że usuwanie obiektów to zadanie źle postawione matematycznie - istnieje wiele prawidłowych wyników, a nie jeden ground truth do porównania.
Proponowane rozwiązanie PROVE wprowadza dwie metryki percepcyjne wyrównane z ludzką percepcją: RC-S mierzy spójność przestrzenną, a RC-T konsystencję czasową między ramkami. Obie metryki analizują edytowany region lokalnie, używając sliding-window Maximum Mean Discrepancy na cechach modelu DINOv2, i żadna nie wymaga referencyjnego nagrania wideo. System dostarcza również PROVE-Bench - dwupoziomowy benchmark z rzeczywistymi scenami z nagrań. To rozwiązanie jest praktyczne do wdrożenia jako harness do ewaluacji modelów.
ProVE wydano jako open-source'owy projekt PyTorch na licencji Apache 2.0 z jednym punktem wejścia CLI. Wymaga Pythona 3.10+, PyTorcha 2.6+, biblioteki Transformers 4.51+ i wag DINOv2-giant. RC-S działa z prędkością 134,6 ms na klatkę na pojedynczej karcie RTX 4090, co czyni system praktycznym nawet dla startupów do nocnych testów CI. Największe korzyści czerpią duże przedsiębiorstwa z obszernym katalogiem edycji, ponieważ nie potrzebne jest sparowane wideo referencyjne. Zastosowania obejmują aplikacje galerii i aparatu w smartfonach, edycję krótkich filmów, czyszczenie katalogów e-commerce'owych czy prace nad materiałami reklamowymi.