DeepSeek je AI industriju okrenuo naglavce, tko su dobitnici, a tko gubitnici?
DeepSeekov streloviti uspon stvara ozbiljan pritisak na ostale proizvođače modela koji će morati popraviti efikasnost kako bi ostali konkurentni. Sjajna je to vijest i za korisnike, koji dobivaju sve bolje i moćnije modele po sve nižim cijenama.
Tehnološki napredak, optužbe za plagiranje (ako ne i krađu) i burzovne drame tresu tehnološki svijet, a glavni “krivac” je DeepSeek, kineski startup čiji model R1 postiže rezultate sumjerljive modelima razvijenim u OpenAI-ju, uz barem 90% niže troškove treniranja.
Nvidia, američki gigant čiji se hardver koristi za treniranje modela, izgubila je 17% tržišne vrijednosti u jednom danu. Ironija kineskog open source modela već danima zabavlja uvijek aktivne korisnike X-a koji oštro kritiziraju američke šampione OpenAI i Anthropic. Legendarni Marc Andreessen proglasio je objavu R1 modela “Sputnjik momentom”, trenutkom koji zapali i motivira cijelu američku naciju da pokaže da oni mogu još bolje.
No, što znamo o DeepSeeku?
Za razliku od većine američkih i europskih tvrtki za velike jezične modele (OpenAI, Anthropic, Mistral) koje su od samog početka podizale značajne runde financiranja od elitnih fondova rizičnog kapitala, DeepSeek je potekao iz kineskog hedge fonda High-Flyer.
Izvršni direktor Liang Wenfeng diplomirao je informacijsku i komunikacijsku tehnologiju na Sveučilištu Džedžang. Čitav je DeepSeekov tim specifičan jer se radi o lokalnim kineskim stručnjacima koji nisu bili na stažiranjima u poznatim zapadnim kompanijama što pokazuje da je, unatoč predrasudama, kineski sveučilišni sustav sposoban obrazovati vrhunske tehnološke stručnjake. Financijska podrška hedge fonda omogućila je DeepSeekovom timu rad u relativnom miru, bez velikog hajpa i medijskih istupa.
Tehničke inovacije
DeepSeekov R1 je reasoning model, dakle veliki jezični model koji je eksplicitno treniran za dulje i kompleksnije “razmišljanje” i planiranje. OpenAI-jevi o1 modeli prilično uspješno rješavaju čak i probleme iz natjecateljskog programiranja, matematičkih olimpijada i standardiziranih ispita.
Nekoliko je bitnih tehničkih faktora u DeepSeeku:
- Mixture of experts: Vrlo pojednostavljenim rječnikom, neki su modeli “stručnjaci” za sve, dok drugi kombiniraju više različitih stručnjaka. U potonjem je slučaju moguće postići velike uštede kako u treniranju tako i kod zaključivanja.
- Domišljatim metodama kompresije (MLA) drastično se smanjuje potreba za memorijom.
- Korištenje 8-bitnih umjesto 32-bitnih brojeva.
- Reinforcement learning bez ljudske intervencije.
Nijedna od tih ideja nije sama po sebi nova, no njihovo kombiniranje u istom sustavu postiže impresivne rezultate. DeepSeekov tim tvrdi da su izvršili treniranje modela za otprilike 5,5 milijuna američkih dolara. Iako treba imati na umu da se ta brojka odnosi samo na konačno treniranje, i dalje se radi o ogromnom skoku o odnosu na postojeće modele.
Kršenje embarga?
Reakcija jednog dijela tehnoloških mogula na objavu R1 modela bilo je odmahivanje rukom, a odmah zatim i optužbe. Alexandr Wang, osnivač Scale AI-ja, otvoreno je prozvao DeepSeek za korištenje Nvidijinih H100 grafičkih kartica nabavljenih na crnom tržištu, protivno embargu na uvoz čipova u Kinu.
Ta je optužba gotovo sigurno netočna. DeepSeek je, prema objavi, koristio slabije H800 kartice koje nisu obuhvaćene embargom. Količina optimizacija koje su bili prisiljeni koristiti govori u prilog službenoj verziji sa slabijim hardverom.
Destilacija – lukavstvo ili pljačka?
Destilacija je metoda u strojnom učenju kojom znanje iz većeg modela (učitelja) prenosimo u manji (učenika). Konkretno, unosimo ulazne naredbe u modela učitelja, prikupljamo izlaze, i potom parove koristimo za treniranje modela učenika. Radi se o raširenoj praksi u industriji, no ona može kršiti pravila korištenja određenih modela.
Postoji teorija, koju zagovara i David Sacks, investitor i “car” za kriptovalute i AI u Trumpovoj administraciji, po kojoj je DeepSeekov tim neovlašteno destilirao OpenAI-jeve modele, što nisu naveli u javnoj objavi. Sacks praksu naziva i krađom intelektualnog vlasništva.
No optužbe su prilično neumjesne s obzirom na OpenAI-jeve brojne kontroverze oko neovlaštenog korištenja intelektualnog vlasništva, kao što pokazuje tužba koju je pokrenuo New York Times. Vašem se kolumnistu destilacija čini legitimnim alatom kojim novi igrači lakše konkuriraju gigantima.
Sigurnost i geopolitika
DeepSeekov model dostupan je u open source, točnije open weights varijanti, ali i putem API-ja. Serveri se nalaze u Kini, što predstavlja potencijalni sigurnosni problem zbog bliske veze vladajuće partije i privatnog sektora. Isti je problem i s DeepSeek mobilnom aplikacijom koja se probila na vrh App Storea.
Kritike na tom tragu posebno su popularne među zaposlenicima konkurentskih tvrtki, no to ne mijenja činjenicu da je model slobodno dostupan i korisnici ga mogu pokretati na vlastitim strojevima.
U tom je aspektu sličan Llami i slabijim Mistralovima modelima, ali ne OpenAI-ju i Anthropicu koji ne objavljuju težine modela. Model u svakom slučaju pokazuje “kineske karakteristike”, no s obzirom da je DeepSeekov tim prilično transparentan oko metoda treniranja, možemo očekivati reprodukciju rezultata bez političke cenzure.
Je li DeepSeek sada tržišni lider, odnosno je li njihov model state-of-the-art. Odgovor je u ovom trenutku vjerojatno ne. R1 model je otprilike na razini OpenAI-jevog o1 modela, koji je slabiji od o3. No efikasnost treniranja DeepSeeka je ogroman pomak.
Pobjednici i gubitnici
Umjetna se inteligencija mijenja ogromnom brzinom i teško je prognozirati ishode (Ben Thompson je objavio vrlo detaljan pokušaj), no jasno je da je ovo velika pobjeda za open source odnosno open weights modele, a problem za OpenAI i Anthropic, na čiju je filozofiju zatvorenih modela i farmi GPU-ova ovo direktan napad.
Za glavnog proizvođača “lopata”, NVIDIA-u, situacija je manje jasna. S jedne se strane može očekivati pad potražnje za hardverom za treniranje modela jer će DeepSeek prisiliti konkurente da budu efikasniji. No s druge strane, jeftiniji su modeli korisni većem broju korisnika i industrija što može dovesti do veće potražnje. Model vjerojatno neće imati negativne posljedice na ostatak big tech kompanija.
Sve u svemu, čeka nas zanimljiva godina u području velikih jezičnih modela. DeepSeekov streloviti uspon stvara ozbiljan pritisak na ostale proizvođače modela koji će morati popraviti efikasnost kako bi ostali konkurentni. No nedavni su događaji sjajna vijest za korisnike, koji dobivaju sve bolje i moćnije modele po sve nižim cijenama, što je razlog za slavlje.

Sukladno članku 94. Zakona o elektroničkim medijima, komentiranje članaka na Netokraciji dopušteno je samo korisnicima koji ostave svoje ime i prezime te mail adresu i prihvate pravila ponašanja.
Pravila ponašanja
Na Netokraciji za vas stvaramo kvalitetan, autorski potpisan sadržaj i zaista se veselimo vašim kvalitetnim, kontruktivnim komentarima. Poštujmo stoga jedni druge prilikom komentiranja, kao i Zakon, držeći se sljedećih pravila ponašanja:
Kako koristimo podatke koje ostavljate? Bacite oko na našu izjavu o privatnosti.
Sve ostale komentare ćemo s guštom spaliti, jer ne zaslužuju svoje mjesto na internetu.