Miliardowy problem AI: kluczowe są dane wysokiej jakości, nie model | Opinia
AI może stać się kolejną branżą wartą biliony dolarów, ale po cichu zbliża się do ogromnego wąskiego gardła. Podczas gdy wszyscy ścigają się, aby budować większe i potężniejsze modele, nadciągający problem pozostaje w dużej mierze nierozwiązany: możemy wyczerpać dostępne dane treningowe już za kilka lat.
- AI kończy się paliwo: Zbiory danych treningowych rosną 3,7-krotnie rocznie i możemy wyczerpać światowe zasoby wysokiej jakości publicznych danych między 2026 a 2032 rokiem.
- Rynek oznaczania danych eksploduje z 3,7 mld USD (2024) do 17,1 mld USD (2030), podczas gdy dostęp do rzeczywistych danych ludzkich maleje z powodu zamkniętych ekosystemów i regulacji.
- Dane syntetyczne to za mało: Pętle sprzężenia zwrotnego i brak niuansów świata rzeczywistego sprawiają, że są ryzykownym substytutem dla chaotycznych, generowanych przez ludzi danych wejściowych.
- Władza przechodzi do posiadaczy danych: Wraz z komodyzacją modeli, prawdziwym wyróżnikiem będzie to, kto posiada i kontroluje unikalne, wysokiej jakości zbiory danych.
Zgodnie z danymi EPOCH AI, rozmiar zbiorów danych treningowych dla dużych modeli językowych rośnie od 2010 roku w tempie około 3,7 razy rocznie. Przy takim tempie możemy wyczerpać światowe zasoby wysokiej jakości, publicznych danych treningowych gdzieś między 2026 a 2032 rokiem.
Nawet zanim dotrzemy do tej granicy, koszt pozyskiwania i kuracji oznaczonych danych już gwałtownie rośnie. Rynek zbierania i oznaczania danych został wyceniony na 3,77 miliarda USD w 2024 roku, a prognozuje się, że wzrośnie do 17,10 miliarda USD do 2030 roku.
Taki gwałtowny wzrost sugeruje wyraźną szansę, ale także wyraźny punkt krytyczny. Modele AI są tak dobre, jak dane, na których są trenowane. Bez skalowalnego strumienia świeżych, zróżnicowanych i nieuprzedzonych zbiorów danych, wydajność tych modeli osiągnie plateau, a ich użyteczność zacznie się pogarszać.
Prawdziwe pytanie nie brzmi więc, kto zbuduje kolejny wielki model AI. Chodzi o to, kto posiada dane i skąd one będą pochodzić?
Problem danych AI jest większy, niż się wydaje
Przez ostatnią dekadę innowacje AI opierały się w dużej mierze na publicznie dostępnych zbiorach danych: Wikipedia, Common Crawl, Reddit, otwarte repozytoria kodu i inne. Ale to źródło szybko wysycha. W miarę jak firmy ograniczają dostęp do swoich danych, a problemy z prawami autorskimi się piętrzą, firmy AI są zmuszone do przemyślenia swojego podejścia. Rządy również wprowadzają regulacje ograniczające scrapowanie danych, a opinia publiczna coraz częściej sprzeciwia się trenowaniu modeli wartych miliardy dolarów na nieopłaconych treściach generowanych przez użytkowników.
Dane syntetyczne są proponowanym rozwiązaniem, ale to ryzykowny substytut. Modele trenowane na danych generowanych przez modele mogą prowadzić do pętli sprzężenia zwrotnego, halucynacji i pogorszenia wydajności z czasem. Jest też kwestia jakości: dane syntetyczne często nie mają chaotyczności i niuansów danych ze świata rzeczywistego, które są dokładnie tym, czego systemy AI potrzebują, by dobrze działać w praktyce.
Pozostają więc dane generowane przez ludzi jako złoty standard, a ich pozyskanie staje się coraz trudniejsze. Większość dużych platform zbierających dane ludzkie, takich jak Meta, Google i X (dawniej Twitter), to zamknięte ekosystemy. Dostęp jest ograniczony, zmonetyzowany lub całkowicie zakazany. Co gorsza, ich zbiory danych często są ukierunkowane na określone regiony, języki i demografie, co prowadzi do uprzedzonych modeli, które zawodzą w różnorodnych przypadkach użycia w świecie rzeczywistym.
Krótko mówiąc, branża AI wkrótce zderzy się z rzeczywistością, którą długo ignorowała: zbudowanie ogromnego LLM to tylko połowa sukcesu. Nakarmienie go to druga połowa.
Dlaczego to naprawdę ma znaczenie
Łańcuch wartości AI składa się z dwóch części: tworzenia modeli i pozyskiwania danych. Przez ostatnie pięć lat niemal cały kapitał i szum medialny koncentrowały się na tworzeniu modeli. Ale w miarę jak przesuwamy granice rozmiaru modeli, uwaga wreszcie przesuwa się na drugą połowę równania.
Jeśli modele stają się towarem, z alternatywami open-source, wersjami o mniejszym rozmiarze i projektami efektywnymi sprzętowo, to prawdziwym wyróżnikiem stają się dane. Unikalne, wysokiej jakości zbiory danych będą paliwem, które zdecyduje, które modele osiągną przewagę.
Wprowadzają one również nowe formy tworzenia wartości. Wkładnicy danych stają się interesariuszami. Twórcy mają dostęp do świeższych i bardziej dynamicznych danych. A przedsiębiorstwa mogą trenować modele lepiej dopasowane do swoich docelowych odbiorców.
Przyszłość AI należy do dostawców danych
Wchodzimy w nową erę AI, w której ten, kto kontroluje dane, posiada prawdziwą władzę. W miarę jak konkurencja o trenowanie lepszych, mądrzejszych modeli się zaostrza, największym ograniczeniem nie będzie moc obliczeniowa. Będzie nim pozyskiwanie danych, które są prawdziwe, użyteczne i legalne do wykorzystania.
Pytanie nie brzmi już, czy AI się rozwinie, ale kto zapewni temu rozwój paliwo. To nie będą tylko naukowcy zajmujący się danymi. To będą zarządcy danych, agregatorzy, wkładnicy i platformy, które ich łączą. Tam leży kolejna granica.
Więc następnym razem, gdy usłyszysz o nowej granicy w sztucznej inteligencji, nie pytaj, kto zbudował model. Zapytaj, kto go trenował i skąd pochodziły dane. Bo ostatecznie przyszłość AI to nie tylko architektura. To dane wejściowe.
Max Li jest założycielem i CEO OORT, chmury danych dla zdecentralizowanego AI. Dr Li jest profesorem, doświadczonym inżynierem i wynalazcą z ponad 200 patentami. Jego doświadczenie obejmuje prace nad systemami 4G LTE i 5G w Qualcomm Research oraz wkład naukowy w teorię informacji, uczenie maszynowe i technologię blockchain. Jest autorem książki zatytułowanej “Reinforcement Learning for Cyber-physical Systems”, wydanej przez Taylor & Francis CRC Press.
Zastrzeżenie: Treść tego artykułu odzwierciedla wyłącznie opinię autora i nie reprezentuje platformy w żadnym charakterze. Niniejszy artykuł nie ma służyć jako punkt odniesienia przy podejmowaniu decyzji inwestycyjnych.
Może Ci się również spodobać
Morgan Stanley obniża cenę docelową Apple (AAPL.US) do 355 dolarów: plan działania jest ekscytujący, ale wycena jest już pełna, a koszt pamięci w każdym iPhone wzrósł prawie o 200%.
Zespół analityków Morgan Stanley pod kierownictwem Erika Woodringa opublikował raport Apple Global Idea, obniżając nieznacznie cenę docelową z 360 dolarów do 355 dolarów, jednocześnie utrzymując rekomendację "przeważaj".
Morgan Stanley: Micron (MU.US) "wysoka koniunktura" może trwać dłużej, podtrzymuje rekomendację "kupuj" i utrzymuje cenę docelową na poziomie 1200 USD
Morgan Stanley zauważa, że w ostatnim czasie dyskusja na rynku przesunęła się z pytania „jak dobre mogą być wyniki” na „jak długo może utrzymać się wysoki poziom aktywności”, a Micron udowadnia, że jego przewidywalność biznesowa stale się przesuwa w kierunku długoterminowym.
Podstawowa inflacja 2,8% pozostaje uporczywa, eksport osiągnął rekordowe 120,9 miliarda dolarów, oczekiwania na podwyżkę stóp procentowych przez Bank Centralny Korei w listopadzie rosną
Podstawowa inflacja wynosi 2,8% i nadal przekracza cel, a ceny transportu wzrosły o 7,7%, co jest głównym czynnikiem napędzającym ten wzrost. Eksport półprzewodników wzrósł aż o 263% do 60,3 miliarda dolarów, co przyczyni się do przewidywanego rekordowego, 28-procentowego wzrostu rocznych dochodów podatkowych. Silny eksport daje bankowi centralnemu przestrzeń dla polityki "podnoszenia stóp procentowych bez szkody dla wzrostu gospodarczego" — ekonomiści przewidują, że w październiku nastąpi pauza, a w listopadzie wznowienie podwyżek stóp, które mogą wzrosnąć do 3,25%.

Bernstein: brak dostępności magazynów będzie trwał do 2028 roku, wyznacza cenę docelową dla Micron (MU.US) na 1300 dolarów
Zespół analityków Bernstein pod kierownictwem Marka Li opublikował szybki przegląd wyników Micron za czwarty kwartał roku fiskalnego 2026, podtrzymując ocenę „przeważania rynku” oraz cenę docelową na poziomie 1 300 USD.
