Od wielkich komputerów wypełniających cały pokój (wymagające centrum danych ciężkie LLM) 🔜 małe, osobiste urządzenia (mieszczący się w urządzeniu konsumenckim LLM).
Choć prawdopodobnie nie zobaczymy pełnej wymiany centrów danych — bardzo liczę na to, że w pełni sprawne LLM mieszczące się w Twoim iPhone'ie nadchodzi.
DeepGrove właśnie udostępniło open-source Maple-Preview i raportuje świetne wyniki. To 20B-A1B model wnioskowania z wagami trójstanowymi (ternary-weight), zbudowany od pierwszego dnia natywnie pod niską precyzję.
Zamiast kompresować duży model, zaprojektowali architekturę 24-warstwową, 256-ekspercką z hybrydową uwagą przesuwnego okna (sliding-window), celowo ograniczając wzrost pamięci KV-cache i maksymalizując przepustowość pamięci.
Choć ten konkretny model możemy na razie porównywać tylko do wyników OpenAI z 2024 roku, kierunek jest jasny.
Większość „efektywnych” modeli zaczyna duże i jest ściskana, by zmieścić się w lokalnym sprzęcie. Ale gdy zmusisz model o pełnej precyzji do niskich szerokości bitowych, napotykasz ograniczenia architektoniczne, które ograniczają zarówno wydajność, jak i efektywność.
Dlaczego podejście DeepGrove działa:
- 218 tokenów/s dekodowania na Mac mini
- 5,31 GB rozmiaru checkpointu na dysku
- Rozwiązuje problemy na poziomie IMO w całości na urządzeniu
- Wydany na licencji MIT
Prawdziwy przełom to nie tylko szybkość — to pętla projektowa świadoma sprzętu. Traktując niską precyzję jako obywatela pierwszej klasy już w trakcie treningu, Maple unika typowych kompromisów kwantyzacji potreningowej.
Został zbudowany pod interaktywne wnioskowanie na urządzeniu, gdzie przepustowość pamięci jest bezwzględnym wąskim gardłem.
Moja szczera opinia: to podgląd skupiony na surowym wnioskowaniu. DeepGrove przyznaje, że miał minimalne post-treningowanie pod zadania agentowe i tylko mało-skalowe RL, więc jako autonomiczny agent może teraz wypadać słabiej. Ale jako dowód koncepcji natywnej wydajności wag trójstanowych to ogromny krok naprzód.
📚 Źródło: https://lnkd.in/dGftuan2
P.S. Ile RAM-u potrzebuje Twój obecny lokalny model wnioskowania, by działać komfortowo? 👇




