NVIDIA udostępniła dwa nowe narzędzia do budowania zawsze dostępnych agentów AI działających na systemach wyspecjalizowanych modeli: Nemotron 3.5 Lightning i router NeMo Switchyard. Problem, który rozwiązują, jest fundamentalny - długotrwale działające agenty spędzają większość czasu na wywołaniach narzędzi, walidacji wyników i delegowaniu do podagentów, a wysyłanie każdego takiego kroku do zaawansowanego modelu rozumowania znacznie zwiększa koszty i opóźnienia.

Nemotron 3.5 Lightning to 30-miliardowy model architektura hybrydowa łącząca Mamba-2, mixture-of-experts i mechanizm attention, z oknem kontekstu 1 miliona tokenów. Kluczowa cecha to zaledwie 3 miliardy aktywnych parametrów podczas działania, co pozwala na 4x szybsze generowanie tekstu w porównaniu z modelami podobnej wielkości. W benchmarku PinchBench na 10 tysięcy zadań Nemotron 3.5 Lightning jest 30 procent szybszy niż Qwen 3.6 35B przy porównywalnej dokładności. Companies takie jak CrowdStrike, Harvey, CodeRabbit, Fastino Labs czy Lila Sciences już dostosowują model do swoich potrzeb w cyberbezpieczeństwie, prawie, kodowaniu, finansach i ochronie zdrowia.

Model jest dostępny bez ograniczeń na licencji OpenMDW-1.1 z otwartymi wagami, danymi treningowymi i przepisami. NVIDIA potwierdziła, że model jest gotów do użytku komercyjnego i może działać na pojedynczym nowoczesnym GPU - zarówno na DGX Spark GB10, jak i na H100. To oznacza, że nie tylko wielkie laboratoria, ale tudi solo deweloperzy mogą wdrażać i dostosowywać te narzędzia do swoich potrzeb.