Przejdź do treści
DeepGrove udostępnia open-source Maple-Preview do wnioskowania na urządzeniu

Piotr Siemiński · 2026

DeepGrove udostępnia open-source Maple-Preview do wnioskowania na urządzeniu

Od wielkich komputerów wypełniających cały pokój (wymagające centrum danych ciężkie LLM) 🔜 małe, osobiste urządzenia (mieszczący się w urządzeniu konsumenckim LLM).

Choć prawdopodobnie nie zobaczymy pełnej wymiany centrów danych — bardzo liczę na to, że w pełni sprawne LLM mieszczące się w Twoim iPhone'ie nadchodzi.

DeepGrove właśnie udostępniło open-source Maple-Preview i raportuje świetne wyniki. To 20B-A1B model wnioskowania z wagami trójstanowymi (ternary-weight), zbudowany od pierwszego dnia natywnie pod niską precyzję.

Zamiast kompresować duży model, zaprojektowali architekturę 24-warstwową, 256-ekspercką z hybrydową uwagą przesuwnego okna (sliding-window), celowo ograniczając wzrost pamięci KV-cache i maksymalizując przepustowość pamięci.

Choć ten konkretny model możemy na razie porównywać tylko do wyników OpenAI z 2024 roku, kierunek jest jasny.

Większość „efektywnych” modeli zaczyna duże i jest ściskana, by zmieścić się w lokalnym sprzęcie. Ale gdy zmusisz model o pełnej precyzji do niskich szerokości bitowych, napotykasz ograniczenia architektoniczne, które ograniczają zarówno wydajność, jak i efektywność.

Dlaczego podejście DeepGrove działa:

  • 218 tokenów/s dekodowania na Mac mini
  • 5,31 GB rozmiaru checkpointu na dysku
  • Rozwiązuje problemy na poziomie IMO w całości na urządzeniu
  • Wydany na licencji MIT

Prawdziwy przełom to nie tylko szybkość — to pętla projektowa świadoma sprzętu. Traktując niską precyzję jako obywatela pierwszej klasy już w trakcie treningu, Maple unika typowych kompromisów kwantyzacji potreningowej.

Został zbudowany pod interaktywne wnioskowanie na urządzeniu, gdzie przepustowość pamięci jest bezwzględnym wąskim gardłem.

Moja szczera opinia: to podgląd skupiony na surowym wnioskowaniu. DeepGrove przyznaje, że miał minimalne post-treningowanie pod zadania agentowe i tylko mało-skalowe RL, więc jako autonomiczny agent może teraz wypadać słabiej. Ale jako dowód koncepcji natywnej wydajności wag trójstanowych to ogromny krok naprzód.

📚 Źródło: https://lnkd.in/dGftuan2

P.S. Ile RAM-u potrzebuje Twój obecny lokalny model wnioskowania, by działać komfortowo? 👇

Grafika Maple-Preview porównująca skompresowane modele z natywnymi obliczeniami trójstanowymi i pokazująca 218 tokenów na sekundę, 5,31 GB oraz model 20B-A1B.
Czytaj oryginał →
OpenAI Releases GPT-6 Astra for Computer-Use Workflows
Piotr Siemiński · wrz 2026

OpenAI Releases GPT-6 Astra for Computer-Use Workflows

Model Routing for Production Agents
Piotr Siemiński · sie 2026

Model Routing for Production Agents

BigQuery Cross-cloud Lakehouse Adds Snowflake Remote Catalog Support
Piotr Siemiński · sie 2026

BigQuery Cross-cloud Lakehouse Adds Snowflake Remote Catalog Support