99/99 – Im więcej wiem, tym mniej zakładam. Remigiusz Kinas

Człowiek, który mówi biegle po angielsku, uczył się rosyjskiego, niemieckiego, a teraz uczy się dwu i pół tysiąca chińskich znaków, twierdzi, że wie coraz mniej. Remigiusz Kinas uważa nieświadomość własnej niekompetencji za główną przeszkodę w pracy. 

Dwa lata temu Remek Kinas twierdził, że Polacy są w stanie zbudować model lepszy od Mistrala, i deklarował, że założyłby się o wszystko. Dziś mówi o tym w czasie przeszłym: „My jako Polska przespaliśmy to kompletnie”. Przez cztery, pięć, może sześć lat nie powstawały u nas centra obliczeniowe ani kompetencje, mimo że kierunek rozwoju AI dało się przewidzieć. Zamiast ryzykować pierwsi, poczekaliśmy, aż Europa potwierdzi, że to wykonalne.

Zapytany, co zrobiłby z dziesięcioma milionami dolarów, nie wybiera budowy kolejnego modelu. Wskazuje laboratorium, zatrzymanie ludzi w kraju. Polska ma algorytmików, którzy wygrywali najlepsze konkursy programistyczne, i to jest przestrzeń, w której da się jeszcze wygrać coś między frontier labs a resztą rynku.

Człowiek przesuwa się na początek i na koniec procesu

Dzień pracy Remka wygląda dziś tak: półtora dnia ręcznego pisania specyfikacji dla dwóch projektów, bez użycia LLM-ów, potem uruchomienie systemów agentowych, a na końcu obowiązek przeczytania i zweryfikowania wszystkiego, co wygenerowały. 

Tryb yolo nie wchodzi w grę. Zniknęła nudna warstwa pośrodku — obsługa plików, API, kod, który trzeba było napisać, żeby w ogóle wystartować. Został problem i weryfikacja.

To zgadza się z diagnozą, którą Remek przypisuje Andrzejowi Draganowi: AI nie ułatwi nam życia, tylko je utrudni, bo automatyzacja zdejmie z nas rzeczy proste i zostawi te wymagające łączenia wielu kompetencji naraz. 

Otwarte pozostaje jedno pytanie, które Kinas nazywa swoją jedyną obawą wspólną z matematykiem Bartkiem Naskręckim: co zrobimy w momencie, w którym pojawią się wyniki, których człowiek nie będzie już umiał sprawdzić.

Dlaczego warto posłuchać?

  1. Metoda oceny modeli, którą wdrożysz w tydzień. Jedno własne, niepubliczne zadanie plus pomiar kosztu, czasu i liczby wywołań narzędzi — zamiast tabel, pod które modele są trenowane.
  2. Konkretny podział pracy z agentami. Gdzie kończy się delegowanie (specyfikacja pisana ręcznie) i gdzie zaczyna obowiązkowa kontrola (czytanie całego outputu przed przyjęciem).
  3. Trzeźwa mapa polskiego rynku AI. Co przegapiliśmy, czego już nie odrobimy i w której niszy — optymalizacja, architektury, inferencja — nadal mamy przewagę kompetencyjną.

Dobrego dnia i niech #AI będzie z Wami wszystkimi!

Transkrypcja rozmowy

Disclaimer. Droga Czytelniczko, Drogi Czytelniku – mała uwaga dotycząca transkrypcji rozmowy. Jak się pewnie domyślasz – transkrypcja została przygotowana z wykorzystaniem magii LLM. Proszę o wyrozumiałość, gdyby pojawiły się w niej niewielkie błędy, literówki, etc. Żeby mieć pewność co do wszystkich wypowiedzi – polecam posłuchać, zamiast czytać. Ukłony.

Karol: [00:00:00] 

To jest dziewięćdziesiąty dziewiąty odcinek podcastu „99 twarzy AI”. Moim wyjątkowym, specjalnym i długo oczekiwanym gościem, z czego niezmiernie się cieszę, jest Remigiusz Kinas.

Remek: Długo oczekiwanym? No tak, bo w zasadzie nie wiem, kiedy próbowaliśmy się spotkać i nagrać…

Karol: Kiedy tylko cię usłyszałem. Było jedno spotkanie online, z jednych kursów. Słyszałem cię na spotkaniu absolwentów, jak zrozumiałym językiem opowiadasz o tym, o czym wszyscy mówią językiem niezrozumiałym.

Remek: Staram się. Dla mnie jeżeli ktoś coś rozumie, to mówi prosto. Po prostu prostymi słowami.

Karol: To chyba Einstein powiedział kiedyś nawet.

Remek: [00:01:00] Całkowicie się z tym zgadzam. Jeżeli ktoś mówi trudnym, bardzo fachowym językiem, to nie twierdzę od razu, że nie rozumie. Staram się natomiast, żeby moi słuchacze czy odbiorcy wynieśli z tych rozmów jak najwięcej.

Mam jeszcze jedną rzecz. Słuchacze pewnie nie wiedzą, ale my jesteśmy prawie sąsiadami. Bardzo często wpadaliśmy na siebie w różnych miejscach, w supermarketach, w sklepach. I za każdym razem potwierdzaliśmy, że tym razem na pewno za tydzień nagramy.

Karol: Jedno z tych spotkań zapadło mi szczególnie w pamięci. Nie wiem, czy je pamiętasz, ale spotkaliśmy się gdzieś na chodniku. Ja miałem głowę w telefonie, ty miałeś głowę w telefonie. Po chwili się zorientowałem. Chyba się minęliśmy, podszedłem [00:02:00] do ciebie, a ty mówisz: „O, przepraszam, nie zauważyłem cię, bo akurat uczę się nowych słówek”.

Remek: Być może tak było, tak. Rzeczywiście wykorzystuję czas niekiedy na naukę języków. To jest mój sposób. Powtarzam sobie słówka, żeby nie wypadły mi z głowy, bo dużo rzeczy niestety mi wypada. Dzisiaj pamiętam, jutro nie pamiętam. Mam więc system zapamiętywania słówek — powtórkowy.

Karol: Żałuję, że nie widzicie miny Remka, kiedy mówi „nauka”, „uczę się”, „nowe słówka”. Pojawia się w tym momencie wielki uśmiech na jego twarzy. Od tego chciałem zacząć. Remek, czym jest dla ciebie nauka i w jaki sposób ty się uczysz? Zakładam, że zupełnie inaczej niż ja.

Remek: [00:03:00] Nauka jest dla mnie właściwie wszystkim. Mam nawet takie wewnętrzne lęki: co by było, gdybym stracił wzrok albo coś takiego. Pewnie i tak bym się uczył. Moją motywacją życiową jest nauka, czyli poświęcanie bardzo dużej ilości czasu na dowiadywanie się nowych rzeczy, na sprawdzanie ich, na zdobywanie nowych kompetencji i umiejętności.

Śmieję się, że mógłbym się nauczyć wszystkiego. Jestem przekonany, że mógłbym się nauczyć bardzo wielu rzeczy, o których ludzie mówią, że nie byliby w stanie ich opanować. Doszedłem chyba do pewnej wprawy. Mam gotowe systemy albo opracowuję sobie systemy do nauki różnych rzeczy.

Karol: To mnie bardzo interesuje. Zdradzisz jeden, dwa, trzy takie systemy? [00:04:00] Do języka? Do umiejętności? Do teorii?

Remek: Jeżeli chodzi o teorię, tę AI-ową, to po pierwsze dużo czytam. Ale na tym nie kończę. Momentalnie implementuję te rzeczy i je sprawdzam. Staram się przejść proces empiryczny: sprawdzić doświadczalnie, jak to pracuje i dlaczego tak jest. Spojrzeć do środka.

Jestem człowiekiem, który pracuje wizualnie, czyli musi widzieć. Dużo rzeczy sobie wyobrażam, właściwie żyję obrazami. Staram się wszystko zobaczyć, wyobrazić sobie.

Jeżeli chodzi o AI, to jest czytanie. [00:05:00] Codziennie przeglądam prasówkę, najczęściej na X, bo tam jest najwięcej informacji z zakresu AI. Czytam, zaznaczam sobie. Dzisiaj dzięki agentom AI i klientom takim jak Codex czy Opus od Anthropic jestem w stanie przygotować prototypy albo zrozumieć cudze prototypy.

Bardzo dużo pracuję też tak, że biorę czyjeś repozytorium i pozwalam agentowi je poznać. Potem zadaję pytanie, jak to jest skonstruowane, jak to chodzi. Przede wszystkim jednak staram się to uruchomić, użyć. Dopiero wtedy rozumiem.

Jeżeli chodzi o naukę języków, to zależy od języka. [00:06:00] Ale zawsze słówka, powtarzanie, a przede wszystkim używanie języka jak najszybciej. Mówienie w nim jak najszybciej. Jeżeli to angielski, staramy się znaleźć kogoś, kto mówi po angielsku. Dzisiaj są platformy internetowe, więc można rozmawiać z ludźmi z całego świata. Przy innym języku wygląda to tak samo: słówka, podstawy gramatyczne-

Karol: Iloma językami teraz mówisz?

Remek: Teraz? To jest bardzo-

Karol: Widzę w twoich oczach, że to trudne pytanie.

Remek: Nie powiem, iloma wszystkimi, bo wydaje mi się, że niewystarczająco dobrze. Kończyłem zaawansowany rosyjski, kończyłem [00:07:00] zaawansowany niemiecki. Cały czas mówię po angielsku, no i po polsku. Do tego mandaryński, czyli chiński — od pewnego czasu uczę się chińskiego.

Niemiecki i rosyjski to języki, które mało praktykuję. Rosyjski właściwie to już historia. Choć czasem mi się przypomina, bo jak ktoś mówi po ukraińsku, to trochę rozumiem, chociaż to inny język. Niemieckiego dziś nie używam, ale kiedy jadę do Niemiec na delegację, w ciągu kilku dni staram się przełączyć i mówić po niemiecku. Czyli wszędzie tak naprawdę liczy się praktyka.

Karol: [00:08:00] Zastanawia mnie to, co powiedziałeś o tym, że ludziom wydaje się, że nie mogą się czegoś nauczyć.

Remek: To wszystko jest kwestia systemu i poświęcenia odpowiedniej ilości czasu. Nie wszystkiego można uczyć się w ten sam sposób. Inaczej uczysz się języków, inaczej kodowania, a jeszcze inaczej rozumienia zagadnień matematycznych. Ja staram się rozpracować albo stworzyć system nauki.

Ten system jest według mnie dość indywidualny. Nawet jeżeli ściągniesz sobie fiszki do języka, gotowy pakiet w Anki, to ja po chwili go poprawiam. Staram się zrobić własną wersję, taką, która do mnie dotrze.

Na [00:09:00] przykład przy chińskim biorę słownictwo z książki, bo nauka chińskiego jest ułożona modułami. Bierze się częstotliwość wyrazów i częstotliwość występowania znaków — to wszystko jest podane. Uczymy się od tych, które pojawiają się najczęściej.

U mnie wyglądało to tak, że wziąłem talie Anki i one mi nie odpowiadały. Albo słabe przykłady, albo słaba wymowa. Wziąłem więc ChatGPT i stworzyłem własne: z ilustracjami, dziś także z dźwiękiem, ze swoimi przykładami, z rozkładem gramatycznym. Zrobiłem te [00:10:00] rzeczy dla siebie. Miałem wtedy taką refleksję, że dzisiaj sami jesteśmy w stanie stworzyć swój system. Nie muszę kupować drogich pakietów do nauki języka. Jeżeli chcemy powtarzać słówka, możemy za pomocą narzędzi AI stworzyć własny zestaw, spersonalizowany pod swój styl, taki, który nam szybko wpadnie do głowy.

W języku chińskim trzeba przecież pamiętać wszystkie znaki. Jest ich bardzo dużo.

Karol: Ile? Dwa tysiące?

Remek: Żeby posługiwać się językiem sprawnie, na poziomie konwersacyjnym — tak, żeby pojechać do Chin i mieć swobodę komunikacyjną — to myślę, że około dwóch i pół tysiąca znaków. Natomiast wszystkich są dziesiątki tysięcy. [00:11:00] W chińskim mamy pismo uproszczone, standardowe. Później mamy dialekty, czyli na przykład kantoński i mandaryński. [przyp. red. — mandaryński to standardowa odmiana języka chińskiego, a nie dialekt; podział na pismo uproszczone i tradycyjne dotyczy zapisu, nie odmian mówionych].

Ważne, żeby zacząć powoli. Na początku jest tam powiedzmy sto pięćdziesiąt znaków. Zaczynamy widzieć, że na X rozpoznajemy pierwsze znaczki. Później jest trzysta.

Mówimy: „O, już jesteśmy blisko”. Później jest powiedzmy dziewięćset, tysiąc dwieście. I pojawia się kolejny skok, do dwóch tysięcy pięciuset, w praktyce do dwóch tysięcy czterystu. Wtedy jesteśmy w stanie słuchać na YouTubie i oglądać chińskie filmy.

Karol: Ostatnie pytanie związane z nauką nowych umiejętności. Tak jak powiedziałem, sprawiasz wrażenie osoby, którą nauka [00:12:00] pasjonuje. Wspominałeś o systemach i o tym, że każdy musi znaleźć swój sposób, swoją metodę na naukę określonej dziedziny. Czy w swojej historii miałeś coś takiego, o czym myślałeś: „O choroba, to nie dla mnie”? A potem okazało się, że znalazłeś drogę i sposób, żeby się tego jednak nauczyć. Zagadnienie, które na początku wydawało ci się w ogóle nie do objęcia.

Remek: Nie do objęcia były tematy związane z moją obecną pracą. Jestem inżynierem, siedziałem w ML-u, w AI, wcześniej w zarządzaniu, a jeszcze wcześniej w czystej informatyce. I dokładnie rok temu przyszedłem do firmy biotechnologicznej.

Karol: Gratuluję.

Remek: Dzięki.

Karol: Bo dokładnie dzisiaj jest chyba rocznica.

Remek: Tak. To znaczy dokładnie było pierwszego [00:13:00] sierpnia. Ale można powiedzieć, że to ten miesiąc. Pierwsze moje wrażenie było takie: tego się nie da ogarnąć. To zupełnie inny świat. I nie tylko pod względem domenowym, czyli biotechnologia i to, co dzieje się w organizmie ludzkim, ale też w zakresie samego AI.

Dzisiaj na przykład, kiedy patrzę na modele językowe, to z punktu widzenia modelowania czy reprezentacji są to zadania proste. Powtarzalne. Właściwie manufaktura, można powiedzieć.

Biologia natomiast jest bardzo skomplikowana. Jak ktoś mówi, że za pięć czy za dwadzieścia lat znajdziemy lekarstwo na wszystko-

Karol: Na wszystkie choroby.

Remek: [00:14:00] To jestem ciekawy, co na to mówią biotechnolodzy. My w większości — nie wiem, czy w większości, ale na pewno po części — w ogóle nie rozumiemy, jak funkcjonują te procesy.

Nawet kiedy patrzymy na dane z eksperymentów robionych w laboratoriach i próbujemy je modelować, to z punktu widzenia machine learningu jest to bardzo heterogeniczne, zmienne środowisko. Wymaga spędzenia bardzo dużej ilości czasu. Po pierwsze, żeby te dane zrozumieć. Po drugie, żeby doprowadzić je do postaci, która pozwoli zbudować model.

Obecnie w Ingenixie spędzamy bardzo dużo czasu na researchu, czyli na badaniach. Szukamy [00:15:00] odpowiedzi na pytanie, w jaki sposób możemy modelować świat biologii i stworzyć model, który będzie tę biologię rozumiał. Podchodzimy do tego tak, że modelujemy nie całość biologii, tylko wycinki, pojedyncze zadania. Staramy się je potem składać w większe rzeczy.

To świat bardzo złożony i trudny. Niekiedy trudno podnieść wyniki modeli o ułamki procenta czy o procenty. Nawet dzisiaj rozmawiałem z kolegą, a on mówi: „Co tu nie zastosujemy, wynik jest zawsze ten sam”.

Wydaje mi się też, że w świecie biologicznym, jeżeli chodzi o AI, jest zdecydowanie więcej porażek niż sukcesów. Przychodzi się do pracy, szuka [00:16:00] igły w stogu siana, a wychodzi się z wrażeniem, że odkryliśmy kilka źdźbeł siana. A ta igła gdzieś tam dalej w stogu jest.

Karol: Po twoim uśmiechu nie widzę, żeby to był problem.

Remek: Nie, bo ja lubię pracować i odkrywać nowe rzeczy. Przyjście do pracy to dla mnie rozpoczęcie dnia pasji. Dzisiaj też tak miałem-

Karol: Właśnie chciałem zapytać, jak wygląda twój dzień i co dzisiaj robiłeś. Gdybyś mógł nazwać te czynności.

Remek: Idąc od początku: budzę się, jadę do firmy. Jadąc, staram się mieć ciszę w samochodzie, żeby nie rozpraszać się za bardzo.

Pierwsza godzina to nauka chińskiego. Zaczynam [00:17:00] dzień od nauki języka. Godzina, cztery razy w tygodniu. Cztery, niekiedy pięć, niekiedy nawet sześć. Z lektorką z Chin, bezpośrednio.

Później zaczynamy pracę. Przyjeżdżam wcześniej przed wszystkimi, żeby mieć spokój. Biorę salkę i godzinę praktykuję. Potem zaczyna się praca i trwa osiem, niekiedy dziewięć godzin.

Cały dzień projektujemy. Dzisiaj na przykład miałem [00:18:00] dwa projekty, które ciągnąłem równolegle. Pierwszy to model multimodalny, fuzja modalności biologicznych. Model stara się znaleźć odpowiedź na pytanie związane — powiem ogólnie — z perturbacją genów. Czy dany gen w terapii antynowotworowej jest genem essential, czyli takim, który jest bardzo ważny. Takim, który można zaatakować jakąś molekułą i wtedy leczymy pacjenta. To jest ten pierwszy model, ta fuzja modalności.

Drugie zadanie to projektowanie nowego modelu, nowej architektury. To [00:19:00] architektura modelu rekurencyjnego opartego o transformery grafowe, służąca do przewidywania efektu perturbacji. Wygaszamy jakiś gen albo w inny sposób na niego działamy i patrzymy, jak odpowiada komórka. Co się z nią dzieje na profilu ekspresji.

Staramy się stworzyć w Ingenixie najsilniejsze modele, jakie są na rynku — mocniejsze niż wszystkie obecne baseline’y. To jest nasz cel: być wyżej. I mamy te sukcesy. Nasze modele potrafią zrobić więcej, odkryć więcej niż inne firmy.

Czyli siedzę i właściwie cały dzień koduję. Koduję lub pracuję koncepcyjnie, czyli wymyślam koncepcję [00:20:00] badania w zakresie AI. Tutaj dużym wsparciem są biotechnolodzy i osoby, które ze mną pracują. Wokół mnie jest bardzo dobry zespół, bardzo fajni ludzie o bardzo dużych kompetencjach.

Mogę powiedzieć, że to unikatowe kompetencje na rynku. Ten core team jest bardzo mocny zarówno AI-owo, jak i biotechnologicznie. Bardzo dużo dyskutujemy o tym, co możemy poprawić w tych modelach i jak.

Karol: Chodzi o to, żeby stworzyć model, który wymyśli jeden lek, czy model, który będzie tworzył lek odpowiedni dla każdego?

Remek: To dobre pytanie. W procesie drug development jest tak, że biotechnolog czy twórca danej molekuły [00:21:00] zadaje pytania. Jeżeli chce wytworzyć jakąś terapię, to w procesie tworzenia tego medykamentu ma dużo hipotez. Albo ich nie ma.

Nasz system próbuje zweryfikować pewne hipotezy-

Karol: Bądź podpowiedzieć.

Remek: Albo generować hipotezy i odpowiadać na nie tak, żeby przyspieszyć produkcję terapii i zmniejszyć jej koszt. Proces wprowadzenia terapii to lata i ogromne budżety. Przyspieszenie choćby o trochę — przez wygenerowanie pewnych hipotez lub obalenie innych — ma więc znaczenie. Z pewnym [00:22:00] prawdopodobieństwem mówimy, że daną hipotezę na pewno należy odrzucić.

Jesteśmy w stanie zmniejszyć liczbę pytań. Laboratoria biotechnologiczne mogą od razu przeprowadzić ten eksperyment, który naszym zdaniem z dużym prawdopodobieństwem zablokuje jakąś ścieżkę sygnałową albo zadziała na geny. Oni sprawdzają to później technicznie w laboratoriach. Ze stu hipotez jesteśmy w stanie wskazać dziesięć, które chcemy sprawdzić. Albo wygenerować nowe.

Karol: Czyli z lekami jest trochę jak z pszenicą albo żytem. Jak opracowuje się nowe odmiany i gatunki ziaren zbóż. W tradycyjny sposób zabiera to lata, bo trzeba czekać i analizować wyniki. [00:23:00] A wy te wyniki w pewien sposób symulujecie na bazie-

Remek: Tak jest.

Karol: Wcześniej istniejących i zebranych danych.

Remek: Tak jest. Mamy różne systemy: modele plus systemy agentowe. One po prostu przyspieszają ten proces.

Karol: A jest przykład, coś już wyszło na światło dzienne, czy na razie to tylko-

Remek: Współpracujemy z firmami. Firmy mają korzyści ze współpracy z nami.

Karol: To znaczy, że opracowują leki szybciej.

Remek: Tak.

Karol: Bardzo interesuje mnie jedno zagadnienie. Pojęcie halucynacji jest znane większości osób korzystających z modeli językowych — model wymyśla coś, czego nie ma. A jeżeli przeniesiemy się na poziom białka? Czy może się okazać, że model wymyśli coś, czego nie ma, a co potem nieopatrznie zostanie wszczepione?

Remek: [00:24:00] Nie, bo my nie generujemy odpowiedzi. Nie ma czegoś takiego, że mówimy „to zadziała”. Generujemy hipotezy, które są później sprawdzane w procesie badań klinicznych. Przyspieszamy ten pierwszy etap, natomiast później jest mnóstwo badań potwierdzających, czy rzeczywiście tak to działa w przyrodzie.

To cały proces. Nie jest tak, że odpowiadamy: „Tak to ma wyglądać i koniec”. To narzędzie tylko wspiera człowieka.

Karol: Czyli tak jak z komórkami macierzystymi. System, który może powiedzieć: „Słuchaj, wypróbuj tę, a nie inną komórkę, bo jest tyle przesłanek mówiących, że jest lepsza od innych”.

Remek: Dokładnie tak. A jak mnie zapytasz o wieczór, wracając do mojego rytmu dnia-

Karol: Bo jest dopiero osiemnasta.

Remek: To staram się nic nie robić, ale [00:25:00] prawie nigdy mi to nie wychodzi. Nie potrafię odpoczywać. To chyba mój największy problem — brak umiejętności zupełnego odpoczynku. Do końca dnia mam jeszcze tyle pomysłów, które chciałbym zrealizować, potwierdzić, sprawdzić, że wieczorem jeszcze dotknę komputera, jeszcze się czegoś nowego nauczę. Jestem osobą, którą te rzeczy fascynują i która chce odkrywać, sprawdzać. Dużo tego mam.

Karol: Ogrom swojego czasu i energii poświęciłeś budowaniu Bielika, wspólnie z całym zespołem i z Sebastianem Kondrackim. Czy mógłbyś podsumować ten czas? Co udało wam się osiągnąć i czego się nauczyliście? Pamiętam spotkanie z Wojtkiem Zarembą w Kluczborku. [00:26:00] Zadałem mu wtedy pytanie, co miałby do powiedzenia całemu zespołowi, który tworzy Bielika. Pamiętam jego odpowiedź. Podkreślił przede wszystkim, że najważniejsze jest to, ile się przy tym nauczycie.

Remek: Chyba tak. Wydaje mi się, że to był proces nauki i ciekawości.

Zainteresowało mnie to przy okazji pewnej historii. Byliśmy na wyjeździe w górach, uczestnicy konkursów Kaggle. To platforma, na której ludzie konkurują ze sobą w konkursach-

Karol: Jesteś podwójnym Grandmasterem, o ile dobrze pamiętam.

Remek: Wiesz co, teraz chyba pojedynczym, bo zmieniła się klasyfikacja. Takim małym Grandmasterem. W Polsce są o wiele lepsi ode [00:27:00] mnie. Darek Kłeczek — to chyba w ogóle najwyższy dzisiaj poziom, jeżeli chodzi o polskiego Grandmastera.

Właśnie z Darkiem rozmawiałem. Szliśmy gdzieś w górach. Darek kojarzył mi się głównie z modelami językowymi, z NLP, czyli z przetwarzaniem języka. To było kilka lat temu.

Mówię: „Darek, zaczęły mnie interesować modele językowe”. Historycznie miałem ścieżkę ML-ową, później ścieżkę wizji komputerowej, też AI-ową. A później marzyłem o LLM-ach. Wystąpiłem wtedy w pierwszym konkursie LLM-owym na Kaggle i chyba zdobyłem tam jakieś wysokie miejsce, [00:28:00] jakoś przypadkowo.

Wydawało mi się, że to jest bardzo proste, ale wszyscy mówili o tych LLM-ach. Mówię: „Darek, chyba z wizji komputerowej przejdę na modelowanie języka, na LLM-y. Mam takie postanowienie, że przez rok będę jedną z najlepszych osób w Polsce, która się zna na LLM-ach”. No i rozpocząłem naukę.

Może nie chodziło o to, żeby być jednym z najlepszych i się z kimś ścigać. Ale tak sobie postawiłem, że chcę to naprawdę dobrze zrozumieć.

Karol: Chcesz znać tę dziedzinę.

Remek: Tak. Pamiętam, że zacząłem studiować LLM-y, całe architektury. Jak działają transformery, jak działa atencja, różne rodzaje atencji — głównie od strony [00:29:00] matematycznej. Później nie do końca było mi to potrzebne, ale dużo czasu spędziłem na tym, żeby zrozumieć, jak to działa matematycznie i jak się trenuje modele językowe.

Później na LinkedInie pojawiła się taka informacja. Krzysztof Ociepa napisał, że rozpoczynają pracę nad polskim modelem językowym. Pamiętam, że odpisałem, że i tak się nie uda. Krzysztof w ciągu pięciu minut do mnie napisał, że jak się nie uda, to zapraszają mnie — może im pomogę. Mówię: „Dobra, jeżeli mnie zapraszają, to przyjdę, zacznę pracować nad tymi LLM-ami i się uczyć”.

To była najlepsza ścieżka nauki LLM-ów, ponieważ tworzyliśmy te modele od zera. Zaglądaliśmy tym [00:30:00] modelom pod maskę: co się dzieje, jak się je trenuje, jak w ogóle ugryźć ten temat. Nie patrzyliśmy z punktu widzenia użytkownika, że wywołuję sobie GPT, patrzę, jak on pisze, i jestem fachowcem od AI. Zawsze staram się iść w kierunku tego, jak AI budować. Jak być bardziej researcherem.

Zaczęliśmy budować ten model. Oczywiście on nadal jest daleko za konkurencją, jeżeli chodzi o frontier labs, bo to mały model. Ale myślę, że bardzo dużo się nauczyliśmy.

Jak patrzę na siebie, to na pewno kwestia fine-tuningu. Cały pipeline do alignmentu w Bieliku robiłem ja. To był w ogóle pierwszy taki pipeline w polskich modelach. Drugą rzeczą, którą robiłem na dużą skalę, był cały pipeline [00:31:00] uczenia przez wzmacnianie, czyli RL. To był też pierwszy model w Polsce, który miał reasoning i był uczony właśnie przez wzmacnianie. Wprowadzaliśmy tam nowe metody, zaimplementowane wcześniej w DeepSeeku.

Później zajmowałem się całą kwantyzacją i optymalizacją modeli. Kolejnym krokiem była współpraca z Nvidią — byłem szefem tego projektu. Wspólnie stworzyliśmy model, który był mniejszym Bielikiem. Staraliśmy się wytrenować model przy niższych kosztach, obniżając koszty treningu.

To był fajny projekt, bo trwał zaledwie trzy tygodnie. Z Nvidią bardzo szybko go zrealizowaliśmy. Używaliśmy [00:32:00] różnych metod pruningu, czyli — krótko mówiąc — zmniejszania wielkości modelu, oraz różnych metod destylacji. To też wyszło bardzo dobrze. Dużo udało mi się tam przepraktykować. Przede wszystkim sprawdzić, jak to pracuje, i dowiedzieć się na innym poziomie, jak to wszystko wygląda.

Karol: Załóżmy, że mamy sierpień. Załóżmy, że jest okolica szóstego grudnia i Remek Kinas dostaje dziesięć milionów dolarów. Co robisz z taką kasą?

Remek: Dziesięć milionów? No to zrobiłbym sobie wakacje. Może nauczyłbym się odpoczywać.

Karol: Ustaliliśmy, że to nie jest możliwe, więc pytam [00:33:00] poważnie. Bo kiedy czyta się różne artykuły-

Remek: Dziesięć milionów dolarów. To jest trudne pytanie.

Karol: Dlaczego pytam? Dlatego że jeżeli porównuje się nasze polskie modele do tych wiodących, to kwestia nakładu czasu, pracy, pieniędzy i ludzi jest zupełnie nieporównywalna. Więc jeżeli padają deklaracje na poziomie kilkudziesięciu milionów złotych czy dolarów — co za to można zrobić?

Remek: To trudne pytanie. Z jednej strony od razu ciśnie się na język: zróbmy model, który będzie najlepszym modelem w Europie. Mówiłem to kilka razy. I to zostało przespane.

Ostatnio korespondowałem na WhatsAppie z Piotrem Sankowskim. [00:34:00] Piotr jeszcze walczy, gratuluję mu tego i życzę powodzenia. Piotrze, jeżeli nas słuchasz — jestem pełen podziwu, leć do przodu. Widzę, że bardzo mocno walczy o to, żeby wykorzystać potencjał AI w Polsce. Tu jest pewna sprzeczność z tym, co powiedziałem „Forbesowi”: że ten potencjał jest raczej mitologiczny.

Dwa lata temu mówiłem, że jesteśmy w stanie przeskoczyć na przykład Mistrala. Wtedy to wydawało się nierealne. Mistral był mocny, był liderem na rynku europejskim. Nikt sobie nie wyobrażał, że można go przeskoczyć, że [00:35:00] to będzie drugie OpenAI czy Anthropic, tylko w Europie.

Oni mocno wyhamowali. Prawdopodobnie — choć tego nie wiem — zajęli się bardziej biznesem niż tworzeniem wolontariacko modeli open source. Tego nie wiem, to po prostu hipoteza.

Ja wtedy mówiłem, że spokojnie Polacy są w stanie stworzyć model co najmniej tak dobry, jak nie lepszy. Byłem w stanie założyć się o wszystko. Byłem przekonany w stu procentach.

My jako Polska przespaliśmy to kompletnie. Przez kilka lat — myślę, że to nawet cztery, pięć czy sześć lat — nie budowaliśmy centrów obliczeniowych. Można było przewidzieć, że AI się rozwija. Nie budowaliśmy centrów obliczeniowych ani odpowiednich kompetencji.

Dzisiaj [00:36:00] jesteśmy w miejscu, w którym coraz mniej mam nadziei, że będziemy liderem. Poczekaliśmy na całą Europę. Czekamy, aż oni potwierdzą, że to jest wykonalne, i wtedy my też będziemy w tym wyścigu. Ale to już jest za późno. Nie wykorzystaliśmy tej szansy.

Przypomina mi to pewien obraz. Widziałeś kiedyś przedstawienie szansy? Tej mitologicznej? Nie pamiętam, u kogo byłem na wykładzie, ale to chyba był Walkiewicz, jeżeli się nie mylę. Pokazywał obraz szansy. To człowiek, który biegnie, a jego włosy — wbrew logice — lecą do przodu, nie do tyłu. Szansę można chwytać tylko z przodu, bo jeżeli przebiegnie, to z tyłu włosów już nie ma.

Nie da się jej [00:37:00] złapać. I to jest właśnie to: nie podjęliśmy tego ryzyka. Teraz będziemy jak wszyscy. Widzę to dzisiaj bardziej pesymistycznie — nie będziemy liderem, będziemy gdzieś razem z innymi. A mogliśmy być. Ja widziałem tę szansę.

Może nie jestem wybitnym specjalistą od przewidywania przyszłości, ale to było na wyciągnięcie ręki. Dzisiaj, gdy pytasz, co bym zrobił z tymi dziesięcioma milionami — chyba nie tworzyłbym nowego modelu. Chyba zainwestowałbym w jakieś laboratorium, w naukę. Zatrzymałbym ludzi, tworzył kompetencje w Polsce. Albo rozwijałbym to, w czym my, Polacy, jesteśmy dobrzy, [00:38:00] czyli optymalizację AI.

Jest tu ogromna przestrzeń, mimo że-

Karol: Na przykład Quesma i Piotrek Migdał [przyp. red. — współzałożycielem Quesmy jest Jacek Migdał].

Remek: Na przykład. Jest duża przestrzeń między OpenAI i Anthropic a innymi firmami. To, co ludzie mówią, że Chiny gonią te laboratoria, to jest patrzenie na benchmarki. Rzeczywistość w ogóle tego nie pokazuje. Kiedy używamy narzędzi OpenAI czy Anthropic, to jest zupełnie inna jakość. Te laboratoria już odjechały i prawdopodobnie będą odjeżdżać dalej.

My w Polsce mamy natomiast bardzo dobrych algorytmików, bardzo dobrych ludzi, którzy potrafią optymalizować, którzy [00:39:00] znają się na pisaniu świetnego kodu.

Moim zdaniem przyszłość leży w optymalizacji tego, co dzisiaj robią duże firmy. Polacy mogliby robić optymalizację architektur, wymyślać nowe architektury. Zresztą Łukasz Kaiser, którego pozdrawiam — jesteśmy umówieni na kawę w San Francisco — jest tego przykładem. Po pierwsze zrobił z ekipą transformera, uczestniczył w tym procesie. Po drugie nadal doradza innym firmom w kwestii architektury. Mówimy na przykład o Pathwayu. Pozdrawiam Zuzę, Adriana, Janka, całą supermocną ekipę z Pathwaya. Widać, że jesteśmy w tym bardzo dobrzy.

Mamy też inference engine’y, czyli vLLM czy SGLang. To serwery, które służą [00:40:00] do serwowania modeli. Wgrywamy model do tego oprogramowania i on odpowiada. Uważam, że Polacy byliby w takiej optymalizacji świetni.

Moglibyśmy stworzyć nie laboratorium konkurujące w tworzeniu bardzo dużych i kosztownych modeli — bo być może w Polsce nigdy nie będzie nas na to stać — ale coś innego. Mamy genialnych ludzi, którzy wygrywali najlepsze konkursy programistyczne. Optymalizowanie jest naszą bardzo mocną stroną.

Karol: Taki pomysł i ambicje ma chyba Kacper Wikieł. Nie wiem, czy się znacie.

Remek: Kacpra znam. Tak.

Karol: Słuchaj, mam do ciebie milion pytań. Muszę cię wykorzystać, skoro mam cię przed mikrofonem. Obalmy parę mitów i wyjaśnijmy parę pojęć, [00:41:00] bo myli się na przykład takie pojęcia jak AGI, ASI i AI. Czy mógłbyś wyjaśnić różnicę między nimi?

Remek: Ostatnio w ogóle śledzę te wątki AGI-owe. AI to oczywiście artificial intelligence, czyli sztuczna inteligencja. Na razie tyle, zaparkujmy to, bo pojadę w dygresję.

AGI miało być następstwem. Czymś bardziej inteligentnym, czyli artificial general intelligence. To miała być koncepcja czy produkt — inteligencja bardzo szeroka. Wychodziliśmy od narrow intelligence, czyli bardzo wąskiej: rozpoznawania, [00:42:00] klasyfikacji, czy to jest kot, czy pies, albo detekcji różnych obiektów. Tak jak — pracuję też jako doradca dla Satim — bierzemy sygnał radarowy z satelity i chcemy robić detekcję obiektów naziemnych.

To jest narrow intelligence. Coś prostego. General intelligence to dla mnie sztuczna inteligencja, która potrafi wiązać różne zdolności kognitywne.

Remek: Tak jak człowiek. Umiemy połączyć czytanie z widzeniem, ze słyszeniem i tak dalej. Na tej podstawie jesteśmy w stanie realizować skomplikowane zadania.

Karol: Czyli łączymy ze sobą kilka zmysłów.

Remek: Kilka zmysłów. To jest szeroka inteligencja, więc [00:43:00] potrafimy zrealizować nie tylko detekcję, ale o wiele więcej.

Powiedziałbym przy tym, że żeby dojść do AGI, musimy tę inteligencję realizować równomiernie. Nie powinno być takiej sytuacji, że jedno bardzo skomplikowane zadanie rozwiązujemy dobrze — na przykład rozwiązujemy problem matematyczny Erdősa, którego nikt nie rozwiązał przez kilkadziesiąt lat, potrafimy dowieźć rozwiązanie — a jednocześnie nie potrafimy odpowiedzieć, ile to jest dwa plus dwa minus jedenaście.

To dla mnie w ogóle nie jest general intelligence. Niektórzy mówią o tym „poszarpana inteligencja”. [00:44:00] I to właśnie obserwujemy w modelach AI. Dodajemy modalności, mamy obraz. W zeszłym tygodniu pokazywałem na X takie przykłady. Mamy kostkę Rubika — znaczy nie kostkę, tylko piramidę.

Pokazujemy sztucznej inteligencji piramidę, kolory jej ścianek. Człowiek jest w stanie bez problemu się domyślić-

Karol: Że to są trzy wymiary.

Remek: Trzy wymiary. Gdzie są ukryte kostki, jakie są kolory ukrytych ścian — można to wydedukować. Sztuczna inteligencja nie była nawet w stanie rozpoznać typu kostki. Nie mówiąc o tym, żeby dojść do tego, co jest na ukrytej ściance. Pytała [00:45:00] dziesięć razy, co tam jest. Trzeba jej było robić wszystkie zdjęcia. Na końcu podała jeszcze zły algorytm rozwiązania, mimo że kostka była osiem ruchów przed końcem i to był ostatni etap układania.

To nie jest general intelligence. Oczywiście duże amerykańskie laboratoria dzisiaj na tym jadą i mówią, że AGI już jest. Google DeepMind na początku sierpnia czy lipca — już nie pamiętam — ogłosiło koncepcję przejścia z AGI do ASI, czyli superintelligence.

Oni już myślą o superinteligencji. Ja uważam, że to marketingowe, głośne hasła, które mają rozpalić nadzieję wśród inwestorów. Że być [00:46:00] może inwestorzy zainwestują i przyniosą pieniądze. My jeszcze tego nie mamy.

Superinteligencja to rzeczywiście inteligencja, która będzie przewyższała człowieka w każdej kwestii. I będzie na poziomie generalnym, czyli będzie potrafiła rozwiązać wszelkiego rodzaju zadania.

Karol: Widziałem kiedyś fajny wykres. Polecam naszym słuchaczom fanpage na Facebooku „Simon Shows You Maps”. Pokazuje przeróżne wykresy i ciekawe statystyki z całego świata. Kiedyś pokazał wykres kosztu wytworzenia jednego kilowata energii [przyp. red. — kilowatogodziny] na przestrzeni lat. Widać było, jak bardzo ten koszt spadł, niemal do zera, w porównaniu z czasami, kiedy energię wytwarzały maszyny [00:47:00] parowe.

Jak sądzisz, co może się wydarzyć w ciągu pięciu, dziesięciu lat, patrząc na rozwój technologii półprzewodnikowych? Na rozwiązania, nad którymi pracuje Pathway, w których i ty miałeś swój udział? Bo pamiętam, jak trzy lata temu po raz pierwszy zobaczyłem ChatGPT. Zaznaczam: nie jestem człowiekiem, który zna się na technologii, co najwyżej potrafię jej używać do określonych rzeczy. Wtedy wydawało mi się, że dotykam chodzącego cudu. A teraz mam zespół agentów, którzy robią rzeczy, o jakich mi się trzy lata temu nie śniło. Biorąc pod uwagę prawo Moore’a i krzywą wykładniczą, zastanawiam się, co się może wydarzyć.

Remek: Nie wiem. [00:48:00] Po pierwsze, trudno mi sobie wyobrazić przyszłość nawet za trzy lata, a co dopiero za pięć. Jeżeli chodzi o technologię, wydaje mi się, że wszystko może się wydarzyć. Ale niekoniecznie, bo widać obecnie pewne ograniczenia technologii AI.

Przez te pięć lat możemy maksymalnie dociskać to, co dzisiaj mamy — architekturę, sprzęt. Jest więc możliwość, że za pięć lat świat niewiele będzie się różnił od dnia dzisiejszego. Ale może być też zupełnie odwrotnie: bardzo duże zmiany.

Ja [00:49:00] sobie tego nie potrafię wyobrazić. Gdybym miał stawiać na jeden z tych dwóch scenariuszy, to wydaje mi się jednak, że zmiany będą solidne. Dużo się zmieni, nie tylko w technologii, ale i w tym, jak ludzie będą żyli. Trzeba tu jednak zachować pewną rezerwę, dlatego że-

Karol: Zróbmy pauzę.

Remek: Jeżeli pytasz o to, co się zmieni za pięć lat, moja odpowiedź jest krótka. No nie wiem.

Karol: I to jest chyba zdrowe podejście.

Remek: Trudno mi sobie wyobrazić rzeczywistość za pięć lat. Może być zupełnie inna niż dzisiaj. [00:50:00] Może zmienić się bardzo dużo, jeżeli chodzi o technologię i o to, jak ludzie będą żyli, bo technologia pewnie będzie miała na ludzi duży wpływ.

Ale od razu przestrzegam przed takim myśleniem. Jesteśmy w dość mocnej bańce technologicznej. To jest nasz świat, my o tym myślimy i podchodzimy do tego bardzo emocjonalnie. Widzimy Terminatora, widzimy zagrożenia, widzimy różne rzeczy. One oczywiście istnieją.

Ale jeżeli wyjdzie się poza tę bańkę, widać normalny świat. Ludzie, którzy korzystają jeszcze ze starych Nokii, chodzą na grzyby, czytają książki, oglądają filmy, grają w warcaby, w szachy, w go. [00:51:00] Dla nich ten świat AI jest zupełnie niezrozumiały.

Nie ma tego świata.

Karol: I niepotrzebny.

Remek: Tak. Jesteś takim odludkiem w tym świecie. Przychodzisz z tym AI, w twojej głowie coś się kotłuje, że tam nowe modele, a ci ludzie patrzą na ciebie i mówią: „O co chodzi?”.

To rzeczywiście może mieć na ludzi wpływ — wdrożenie AI w firmach. Ale jestem zwolennikiem podejścia, że AI będzie czymś, co ludzi wspiera. Nie zabierze im pracy do końca. To znaczy na początku może zabierać. Myślę jednak, że zdrowy rozsądek tu zadziała i będą to narzędzia, które będą bardzo [00:52:00] wspierały ludzi w osiąganiu nowych celów.

Tak jak książka, tak jak pismo. Oczywiście to bardziej przełomowe i szybciej się rozwija. Ale uważam, że to będzie przyjaciel człowieka.

Druga wizja jest taka, że może się nic nie zmienić. Za pięć lat obraz może być bardzo podobny do dzisiejszego. Podchodzę do tego chłodno, ponieważ widać pewne ograniczenia technologii, którą obecnie wykorzystujemy do budowania AI.

Widzimy wyczerpywanie się zasobów, czyli tego, na czym uczymy. Widzimy też końcówkę, czy wręcz koniec możliwości skalowania. W nieskończoność tych rozwiązań nie będziemy skalować. Może się więc [00:53:00] okazać, że jeżeli ktoś nie wymyśli nowych technologii, to przez te pięć lat niewiele się posuniemy. Obecnie zrywamy nisko wiszące owoce, które wydają nam się przełomowe.

Karol: Ethan Mollick napisał kiedyś, że gdyby technologia zatrzymała się na dzisiejszym etapie, zajęłoby nam chyba dziesięć lat zrozumienie jej pełnych możliwości.

Remek: Może tak. Ale trudno w ogóle przewidywać. Wszyscy ci, którzy przewidywali — gdybyśmy się cofnęli i sprawdzili, co mówili, że będzie za rok — myślę, że-

Karol: Jak z ekonomistami. Najlepiej tłumaczy się krach już po fakcie.

Remek: Dokładnie tak. To były raczej nietrafione spekulacje. Że coś tam nastąpi, nie wiadomo co. [00:54:00]

W AI trzeba moim zdaniem mieć ostudzone emocje.

Karol: Oczekiwania.

Remek: Emocje. Bo to, co widzimy, to samonapędzające się koło. Ktoś wrzuca nowy model i wszyscy mówią: „Wow, pobił wszystkie inne modele”.

Karol: Tak samo jak iPhone.

Remek: Tak. To wszystko jest nakręcone pod konkretny cel: zdobycie pieniędzy, zdobycie inwestorów, zdobycie palmy pierwszeństwa, przegonienie wszystkich. To pościg. Tylko trzeba do tego podchodzić naprawdę spokojnie. Popatrzeć, potestować, sprawdzić, czy w moim zadaniu, w moim procesie ten model [00:55:00] w ogóle działa. Dopiero później się wypowiadać.

Dzisiaj rządzą emocje. Chiński model wchodzi na rynek i wszyscy momentalnie patrzą na benchmarki, które w większości są naprawdę lipne, bo modele są pod nie przeuczone.

Te benchmarki nie spełniają swoich zadań. Zresztą benchmarki po pewnym czasie trzeba zmienić — tak samo jak KPI w firmach. Wszyscy optymalizują się pod te KPI i na końcu mamy wskaźnik, który przez cztery lata stoi na poziomie dziewięćdziesięciu pięciu procent i nikt nie wie, jak go poprawić. Całe procesy dostosowały się do tych KPI. Firma niekoniecznie musi przy tym świetnie prosperować, bo świat się zmienia, a my nadal optymalizujemy się pod stare wskaźniki. Tak samo jest z modelami [00:56:00] językowymi. Dlatego podchodzę dziś do tego na luzie.

Karol: Modelowanie świata. Na czym dokładnie polega model świata?

Remek: To jest to, co my mamy w głowie. Zrozumienie, jak świat funkcjonuje, i podejmowanie decyzji w locie na podstawie tego rozumienia. Każdy [00:58:00] człowiek ma swój model świata. Po pierwsze, jest on trochę nadany genetycznie. Po drugie, jest tworem uczenia przez wzmacnianie.

Jeżeli popatrzymy na małe dziecko, to ono eksperymentuje. Na początku nie rozmawia z tobą o tym, jak obliczyć grawitację czy jak poruszyć się z punktu A do B. Nie zna praw Newtona.

Karol: Śmieję się, bo używam podobnego przykładu z dzieckiem. Kiedy ktoś mówi, że próbuje coś zrobić. Gdyby dziecko tylko i wyłącznie próbowało nauczyć się chodzić, poniosłoby klęskę.

Remek: Dokładnie tak. Dziecko wkłada śrubokręt do-

Karol: Gniazdka.

Remek: Gniazdka. Nie róbcie tego w domu. [00:59:00] Ono eksperymentuje i dostaje informację zwrotną ze świata. W ten sposób poznaje świat i środowisko.

Jest ciągła interakcja między środowiskiem a agentem, czyli dzieckiem. Agent porusza się w świecie, cały czas jest w interakcji i albo dostaje nagrodę, albo karę. To środowisko jest w przypadku ludzi dość skomplikowane, bo działają w nim różne prawa fizyki i różne losowe zdarzenia.

My cały czas eksperymentujemy. Im więcej tych zdarzeń, tym nasz model świata jest prawdopodobnie doskonalszy. Mówimy przecież, że starsi ludzie mają duże doświadczenie. Albo ludzie, którzy brali udział w wielu projektach, [01:00:00] mają wielkie doświadczenie. Model świata buduje się przez doświadczenie, przez interakcję, a nie tylko przez czytanie książek. Musimy wejść w interakcję.

Tak samo robot czy AI. W AI budujemy modele świata. Na przykład model ukierunkowany na akcję. Jedzie samochód autonomiczny. Weźmy sytuację, która wkurza wielu kierowców po wprowadzeniu przepisu, że pieszy ma zawsze pierwszeństwo na przejściu. Człowiek idzie wzdłuż chodnika, w pewnym momencie się odwraca i my jako kierowcy nie wiemy, czy wejdzie na pasy, [01:01:00] czy pójdzie dalej.

Samochód autonomiczny też musi przewidzieć tę akcję. Musi mieć jakiś model świata i zrozumieć, czy człowiek wchodzi na pasy, czy tylko się zawahał i idzie do przodu. Musi to przewidzieć z dużym prawdopodobieństwem. Są więc algorytmy, które przewidują kolejne akcje. Jesteśmy w stanie przewidzieć ileś klatek do przodu i zrozumieć, jak działa ten świat.

Jeżeli ciało jest odpowiednio ułożone i odpowiednio idą gradienty ruchu, to znaczy, że ten człowiek będzie przechodził. System autonomiczny musi stanąć. Staramy się zrozumieć, jak działa świat, i tak samo robot stara się to zrozumieć.

Jeżeli popatrzymy cztery, pięć lat [01:02:00] wstecz, to w świecie robotyki nastąpił ogromny postęp. Cztery czy pięć lat temu jeździłem na targi związane z robotyką, powiedzmy w Stuttgarcie. Pokazywali tam różne zastosowania robotyczne.

Wtedy nie było robotów, które podnoszą skomplikowane rzeczy albo wykonują skomplikowane ruchy. Były oczywiście roboty produkcyjne-

Karol: Podchodź, przenieś.

Remek: Tak. Bo przecież inaczej podnosimy butelkę, a inaczej szklankę. Co się stanie, jeżeli dany przedmiot jest przezroczysty?

Karol: Albo śliski.

Remek: Dokładnie tak. Jeden przedmiot może mieć dziesięć kilogramów, drugi dwa, a jeszcze inny może być bardzo [01:03:00] delikatny. Robot musi to wszystko zaplanować i zrozumieć, jak to funkcjonuje. Cztery lata temu to były podstawowe problemy. Dzisiaj widzimy tańczące roboty, chodzące, różne pokazy-

Karol: Pobijające rekordy nawet Usaina Bolta.

Remek: Tak. Ten postęp jest ogromny. Ale znowu: czy przez kilka lat doprowadzi do tego, co mówił Tomasz Czajka — że w dwa tysiące trzydziestym piątym roku będzie na ulicach więcej robotów humanoidalnych niż ludzi? Nie wiem. Być może pojawią się problemy technologiczne, które uniemożliwią wykorzystanie pełni potencjału. Dzisiaj ten postęp jest ogromny, ale-

Karol: DCIP [niezrozumiałe] nie wystarczy? [01:04:00]

Remek: Nie wiem. Naprawdę trudno mi mówić o przyszłości. Raczej staram się patrzeć tu i teraz, na to, co ludzie wymyślają.

Karol: Dobra, to patrzysz tu i teraz. Co według ciebie jest największym bullshitem?

Remek: W zasadzie już to powiedziałem. To ciągłe mówienie o AGI, że już je mamy albo że jesteśmy blisko. Moim zdaniem nie jesteśmy blisko. Jesteśmy raczej daleko. Przynajmniej jeżeli chodzi o moją definicję AGI.

Może frontier labs wiedzą więcej. Ja tego nie wiem. Na pewno mają u siebie lepsze modele, ileś wersji do przodu. Może więc wiedzą więcej i dlatego są tego pewni. Ale wydaje mi się, że to pierwsza rzecz: [01:05:00] cały ten temat AGI.

Druga to temat, o którym już mówiłem — emocjonalne podejście do AI. Na pewno kwestia końca świata i tych wizji w ogóle mi nie odpowiada. Świat Terminatora to nie jest mój świat, jeżeli chodzi o AI. Szanuję oczywiście osoby, które tak myślą i widzą ten świat w czarnych kolorach. Doceniam różnorodność.

Ale dlaczego AI miałoby takie być? Miałoby konkurować o wspólne zasoby, kończyć z ludzkością? Nie widzę w ogóle celu, dla którego AI miałoby [01:06:00] takie być.

Widzę raczej, że AI to narzędzie, które będzie pomagało ludziom. Widzę coś, co się dzisiaj nie sprzedaje: pokazywanie przyszłości jako fajnej przyszłości, w której będzie nam żyło się łatwiej. W której łatwiej wykonamy pewne zadania.

Strach zawsze był narzędziem kontroli. Dzisiaj nie widzę żadnego powodu, dla którego autonomiczne AI miałoby skończyć z ludźmi na Ziemi. Największym zagrożeniem dla ludzi są ludzie. Tak jak przy wszystkich narzędziach, które do tej pory [01:07:00] wynaleziono.

To, co rzeczywiście może nastąpić, jeżeli mówimy o kataklizmach, wydarzy się wtedy, kiedy pozostawimy AI całkowicie niekontrolowane. Kiedy oddamy decyzje w bardzo ważnych procesach systemom, których nie rozumiemy. Ale to nadal człowiek zdecyduje, że od dzisiaj ten system będzie podejmował decyzje o tym, jak kontrolować elektrownię atomową. A my jako ludzie wyjdziemy z tej elektrowni i będziemy robić coś innego.

Nie widzę czarnego scenariusza, w którym pojawia się jakaś przezroczysta postać, chodzi i tłucze ludzi na prawo i lewo. Bo dlaczego miałaby to robić?

Karol: Pytanie, które chodziło [01:08:00] mi po głowie, kiedy jechałem na nasze spotkanie. Chociaż teraz, kiedy rozmawiamy, wydaje mi się, że wiem, jak odpowiesz, ale muszę je zadać. Odciążenie poznawcze. Czy ty sam miałeś kiedyś sytuację, w której poczułeś u siebie odciążenie poznawcze?

Remek: Właściwie codziennie. Obciążenie poznawcze, czyli jestem przeciążony poznawczo, przytłoczony-

Karol: Ja mówię o zachowaniu znanym jako cognitive offloading. Mój przykład: orientacja w przestrzeni i w topografii miasta. Kiedyś doskonale znałbym dzielnice, podziały, nazwy ulic. Korzystam z Google Maps właściwie od zawsze. I jak wygląda moja orientacja w terenie? Potrafię zgubić się na parkingu w centrum handlowym.

Remek: To jest pytanie o to, czy stracimy jakieś [01:09:00] umiejętności poznawcze, bo nasz mózg nie będzie w tym zakresie używany.

Karol: Tak. Bo wiesz co, ja też czasami zapisuję sobie myśli dziwnej treści. I patrząc na to, co zyskujemy dzięki modelom językowym — a raczej co nam się wydaje, że zyskujemy — to zyskujemy pewną wszechmoc. Jakiego bym nie miał pytania, zaraz będę miał odpowiedź. Jakiego bym nie miał problemu, zaraz będę miał rozwiązanie. Wielu osobom może się więc wydawać, że mamy pełnię mocy. Z drugiej strony tracimy pewną siłę. Tę, która jest potrzebna choćby wtedy, kiedy chcesz zbudować mięśnie: trenuj, chłopie, przez trzy lata, cztery razy w tygodniu, a wtedy będziesz miał silne ciało, silne mięśnie, zdrowe kości i zdrowy organizm.

Remek: Myślę, że tutaj będzie podobnie. Pretekstem do nauki języka chińskiego było u mnie [01:10:00] wyzwanie intelektualne. Ale na innym poziomie niż praca przy AI — praca matematyczna, eksperymentalna, badawcza. To jest nauka trochę wizualna, praca ze znakami, z zupełnie inną logiką języka, z inną kulturą.

Karol: Wejście na całkowicie nieznany grunt.

Remek: Tak. Moją motywacją było to, żeby potrenować mózg. Żeby ten mięsień był jak najszerzej wykorzystywany. Ale wydaje mi się, że to zależy od człowieka.

Jeżeli będziemy w stu procentach wykorzystywać technologie, które zwalniają nas z używania tego mięśnia, to moim zdaniem [01:11:00] te umiejętności rzeczywiście będą zanikały. Tak jak powiedziałeś — świetna ta metafora z mięśniami.

Dzisiaj miałem taką sytuację. Mówiłem o tych dwóch projektach, które realizuję. Systemy agentowe działały. Najdłużej zajęło mi pisanie specyfikacji. Pisałem ją ręcznie, nie używałem LLM-ów. Całą specyfikację dla dwóch projektów pisałem przez półtora dnia.

Później ruszyły systemy agentowe i rozwijały tę koncepcję na realizację danego projektu. Wyszedłem z biura, a tu idzie kolega i już widzę, że czaszka mu dymi. Czerwone oczy. Mówię: „Co, [01:12:00] Tomek? Już jesteś przeładowany?”. On mówi: „No tak”. Mówię: „Słuchaj, moje dwa agenty skończyły pracę i teraz będę musiał to wszystko przeczytać”. Bo u nas rzeczywiście generujemy, ale potem trzeba to przeczytać i zweryfikować.

I my to robimy. Nie jest tak, że wszystko leci automatem, a my podnosimy ręce i mówimy: „Dobra, to teraz-„

Karol: Tryb yolo.

Remek: Tak. Czytamy. Natomiast jeżeli zdamy się w stu procentach na odciążenie, to myślę, że pójdziemy w kierunku utraty tych umiejętności kognitywnych.

To jest tak jak dzisiaj z telefonami komórkowymi i portalami społecznościowymi. Scrollowanie, ciąg dopaminowy, pętla dopaminowa. To rzeczy, które na [01:13:00] pewno trwale zmieniają nasz mózg. I ta zmiana będzie postępowała pokolenie po pokoleniu.

Karol: Skoro o wymianie pokoleń — mam taką hipotetyczną sytuację. Załóżmy, że jesteś rodzicem czterolatka, sześciolatka, siedmiolatka. Czego byś go uczył? Jego, ją.

Remek: Matematyki albo fizyki. Tak mi się wydaje.

Chociaż Bartek Naskręcki z Poznania, którego też pozdrawiam, coraz częściej mówi co innego. Bardzo dobry, wyśmienity matematyk. [01:14:00] Często nie rozumiem, o czym on mówi, ale to matematyk, który wyśmienicie korzysta z narzędzi AI w swojej pracy.

Przemek Sajko wrzucił kiedyś na X takiego mema — też go pozdrawiam. Był tam obrazek, na którym starsi ludzie wciskają przycisk przy automatach w kasynie. I pokazał, że teraz matematyk będzie tak wciskał enter, enter, enter.

Ale jak rozmawiałem z Bartkiem, to wydaje nam się, że ten kierunek jest inny. Że modele pomogą nam wznieść się na zupełnie inny poziom. Wykonywać tę pracę i odkrywać nowe rzeczy. Obawiamy się właściwie tylko jednej rzeczy: że dojdziemy do takiego [01:15:00] momentu, w którym człowiek nie będzie w stanie weryfikować-

Karol: O to właśnie chciałem zapytać.

Remek: Weryfikować tego, co model wymyślił. To będzie problem. Pojawią się dowody, przy których człowiek nie będzie w stanie pojąć, skąd model to wziął.

Zresztą mówił o tym Andrzej Dragan, którego też pozdrawiam — dzisiaj pozdrowię wszystkich. Andrzej mówił, że AI nie ułatwi nam życia. AI je utrudni, bo będzie wymagało od nas o wiele większych kompetencji. Proste rzeczy na początku zostaną zautomatyzowane, ale te trudne zostaną przy nas. Te bardzo skomplikowane, o których mówiliśmy przy okazji general intelligence — wymagające wielu umiejętności kognitywnych. AI w tych [01:16:00] zadaniach nie będzie sobie radziło.

Będzie więc od nas wymagało dużych umiejętności poznawczych, dużej umiejętności łączenia kropek. Mówię o zadaniach związanych z wiedzą, bo będą oczywiście też zadania związane z umiejętnościami manualnymi. Fryzjer czy ktoś, kto remontuje dom.

Ale jeżeli mówimy o środowisku, w którym używamy głowy do wytwarzania pewnych rzeczy, to dla ludzi zostaną rzeczy bardzo skomplikowane. I to bardzo szybko. Będą od nas wymagały większych umiejętności. Tak to będzie wyglądało.

Karol: Jak na ciebie patrzę i ciebie słucham, to mówisz o językach, o teorii — i te rzeczy odkładają mi się na jedną półkę. A czy miałeś kiedyś ochotę zająć się [01:17:00] rzeźbiarstwem? Czymś manualnym?

Remek: Sportem. Przez lata trenowałem triatlon.

Karol: Nie mówię o sporcie. Zobacz, że przy rzeźbieniu musisz mieć i wyobraźnię, i rękę, która przełoży to, co myśli głowa.

Remek: To się zgadza. Kiedy byłem zdecydowanie mniejszy, większość czasu spędzałem na rzeczach manualnych. Teraz zaskoczę: robiłem ceramikę.

Karol: Czyli to już było.

Remek: Tak. Ceramika, wszelkiego rodzaju kółka plastyczne, malowanie. [01:18:00] I to chyba tyle, jeżeli chodzi o takie rzeczy. Pamiętam, że jakieś wazony jeszcze do niedawna gdzieś były.

Miałem tę wyobraźnię i chyba nadal całkiem nieźle rysuję. Ale zawsze ciągnęło mnie do matematyki i do fizyki. Tyle że wydaje mi się, że miałem nie najlepszych nauczycieli i nie najlepsze sposoby na naukę fizyki.

Wracając więc do pytania o małych ludzi, tych cztero-, pięciolatków — to jest właśnie kwestia matematyki i fizyki. Nie uważam, żeby to były tematy, które znikną.

Karol: To jak uczyłbyś tej fizyki i matematyki?

Remek: Wszystko przez eksperymenty, przez [01:19:00] projekty, przez doświadczanie. Dla mnie to podstawa. To jest tak, jak idziesz do Centrum Nauki Kopernik i doświadczasz. To musi bawić.

Główną przyczyną tego, że młodzież nie chce chwycić fizyki czy matematyki, jest podręcznik, tablica, nudne zajęcia. Ja starałbym się rozpalić miłość do matematyki czy fizyki właśnie przez eksperymenty, przez pokazy. Przez pokazywanie — czasem zamiast marnować lekcję — co ludzie kombinują na YouTubie. Mamy przecież fantastycznych ludzi, którzy potrafią opowiadać o fizyce i pokazywać takie rzeczy, że [01:20:00] to od razu wchodzi do głowy. Tak bym do tego podszedł: starałbym się te rzeczy pokazywać.

Karol: Wspominałeś, że przez półtora dnia pisałeś specyfikację dla twoich dwóch agentów albo dwóch zespołów agentów. Najpierw szybkie pytanie organizacyjne. Jak piszesz? Odręcznie, na klawiaturze, czy używasz trybu głosowego?

Remek: Piszę na klawiaturze.

Karol: Okej. To co musi się stać, żeby agent, którego wykorzystujesz, stał się twoim pełnoprawnym pracownikiem, a nie asystentem?

Remek: On już dzisiaj jest pracownikiem. Mieliśmy zresztą dzisiaj dobrą rozmowę z kolegą, z Rafałem. Rafał Powalski z Ingenixa — też go pozdrawiam. Super fachowiec. [01:21:00] Świetnie mi się z nim dyskutuje. Rafał prowadzi projekty, robi pewną część projektu, elementy składowe eksperymentów biologicznych.

Zaczęliśmy dzisiaj rozmawiać o tym, że bardzo dobrze nam się teraz pracuje. Kiedyś, żeby zrobić nawet podstawową rzecz, musieliśmy napisać dużo nudnego kodu. Obsługa plików, obsługa jakichś API. Potrzebowaliśmy wnieść dużo pracy, żeby w ogóle wystartować z projektem.

Dzisiaj koncentrujemy się na problemie. Rozmawiamy z agentami, nie patrząc na aspekty implementacyjne. Raczej patrzymy [01:22:00] na efekt i mówimy: tutaj coś zepsułeś, trzeba poprawić. Naszym przeciwnikiem jest problem.

I to jest różnica — tutaj przy okazji zareklamuję Ingenixa — w tym, jak się pracuje. Ja przez wiele lat pracowałem w różnych korporacjach, lepszych i gorszych. Historia Neuca to historia super, wspominam ją bardzo dobrze.

Ale miałem do czynienia z różnymi firmami i bardzo często problemem w tych firmach jest człowiek. Relacje interpersonalne, ktoś kogoś obgaduje. A nie problem. Tutaj naszym największym przeciwnikiem jest problem. Pracuję w tej firmie rok i nie [01:23:00] usłyszałem nigdy, żeby ktoś mówił, że ktoś inny coś zepsuł albo czegoś nie potrafi.

Zbudowaliśmy taką kulturę, w której naszym wyzwaniem jest pokonanie problemu. To jest nasz przeciwnik, a pracownik jest partnerem. Jeżeli komuś coś nie wychodzi, wszyscy jesteśmy odpowiedzialni za to, żeby mu pomóc pójść do przodu, i to jak najszybciej, żeby nie stał w miejscu.

Świetny jest tu też niesamowity poziom odpowiedzialności i autonomii ludzi. Dla mnie pewnym szokiem było to, że tutaj ludzie biją się o zadania. Kto weźmie zadanie — a nie odsuwają się, żeby być od niego jak najdalej.

Gdybym miał opisać środowisko, o którym zawsze marzyłem, [01:24:00] to jest to środowisko badawcze bez polityki. Rozwiązujemy problem, szukamy sposobów na jego rozwiązanie, staramy się być codziennie troszeczkę lepsi.

I mimo że mamy dużo porażek — nie wychodzi, nie wychodzi, nie wychodzi — to kiedy pojawia się sygnał, że skaczemy, że mamy coś powyżej baseline’u czy powyżej SOTA [przyp. red. — state of the art, najlepszy dotychczasowy wynik], to rzeczywiście wszyscy się cieszymy i świętujemy. Że jesteśmy kawałek dalej i pokonujemy najlepszych. Atmosfera w takim środowisku badawczym jest mega istotna.

Karol: A z kim teraz konkurujecie?

Remek: Nie [01:25:00] konkurujemy. To chyba dobra odpowiedź. Nie konkurujemy w takim sensie, że bardzo podobne rzeczy robi DeepMind, ale to nie jest zupełnie konkurencja. Pojawiają się też symulatory komórek, modele modelujące reakcje czy biologię komórki.

Karol: Mówisz o AlphaFoldzie?

Remek: Nie. AlphaFold to akurat też DeepMind i to jest zwijanie struktury białek. To jeden z ich modeli, który my również wykorzystujemy — czy to AlphaFold, czy Boltz.

My konkurujemy sami ze sobą. To daje pewien komfort. Bierzemy oczywiście GPT jako nasz [01:26:00] benchmark, bierzemy systemy agentowe, czyli Opusa, jako benchmark w naszych systemach agentowych. Ale nastawienie jest raczej takie, że chcemy codziennie odkrywać fajne rzeczy.

Mamy wizję produktów i chcemy codziennie pokonywać raczej siebie. Nie ma tego stresu, że przychodzę do pracy i „o kurczę, DeepMind coś ogłosił”. Pod tym względem jest spokój. I to spokój od samej góry: Adam i Piotr też są spokojni. Róbmy swoje, najlepiej jak potrafimy.

Zbudowali super zespół z super specjalistów. Adam ma, wydaje mi się, świetną umiejętność budowania zespołów. Szukają ludzi, którzy pasują do zespołu zarówno mentalnie, jak i pod względem umiejętności. [01:27:00] I codziennie mamy być kawałek dalej.

Mamy więc spokój mentalny. Nikt nad nami nie siedzi z wynikami, wynikami, wynikami. Jako startup chcielibyśmy oczywiście jeszcze szybciej. Chcielibyśmy mieć już produkty i pokazywać je na zewnątrz. Ale mamy duży spokój w pracy i bardzo duży poziom zaufania właścicieli. Oni nam bardzo ufają w tym, co robimy, i wierzą, że ten sukces do nas przyjdzie.

My też w to wierzymy. Mówiłem o Rafale, mówiłem o sobie — my widzimy te produkty oczami wyobraźni. Widzimy już komponenty, które się składają i które potwierdzają nasze hipotezy, że idziemy w dobrym kierunku.

Karol: Brzmi ciekawie. [01:28:00] Czy mógłbyś jeszcze na koniec naszej rozmowy wyjaśnić, na czym polega rewelacja, którą pokazał Pathway?

Remek: To ciekawa historia. Tak jak powiedziałem, pracuję w Ingenixie. To moja podstawowa praca, w stu procentach.

Karol: Ale ustaliliśmy już, że nie wiesz, co robić z wieczorem.

Remek: Tak. Oprócz tego od czasu do czasu pomagam Satimowi. To krakowska firma, która tworzy najlepsze na świecie systemy do monitoringu satelitarnego, w technologii SAR, czyli radarowej. Pomagam tam jako doradca CTO w zakresie budowy pipeline’ów treningowych dla wizji komputerowej.

To dość specyficzna wizja komputerowa, bo leci [01:29:00] satelita radarowa i robi zdjęcia radarem. Te zdjęcia wyglądają dość specyficznie, a firma tworzy świetne rozwiązanie do-

Karol: Wizualizacji.

Remek: Do detekcji i klasyfikacji obiektów, które są na Ziemi. Można na przykład sklasyfikować statki stojące w portach czy samoloty na lotniskach.

A Pathway to taka historia. Kiedyś na LinkedInie pochwaliłem się swoimi pracami dotyczącymi kompresji tak zwanego KV cache’a w transformerach. Tego, jak przyspieszyć tę optymalizację, jak kompresować coś, co w transformerach bardzo rośnie. [01:30:00]

Napisał do mnie Janek, CTO Pathwaya. Janek jest studentem Hintona, pracował też w Google Brain. Napisał, że zainteresował się tym, co piszę, bo oni pracują nad nową architekturą. Oczywiście nie powiedział mi, co to za architektura. Powiedział, że chętnie by ze mną porozmawiał. Nawiązaliśmy kontakt.

Później poznałem Zuzannę i Adriana. Była też taka sytuacja, że [01:31:00] Pathway chciał mnie zatrudnić, ale dosłownie tydzień wcześniej zatrudniłem się w Ingenixie. Powiedziałem, że jeżeli złożyłem komuś obietnicę, że przychodzę do danej firmy, to dla mnie to święte słowo. Dałem Adamowi i Piotrowi słowo, że przychodzę do Ingenixa. Sorry, spóźniliście się.

Ale do dnia dzisiejszego utrzymujemy z Pathwayem bardzo dobrą relację. Zuza ostatnio napisała, że jestem przyjacielem Pathwaya. Jak byłem ostatnio w Stanach, to ich odwiedziłem. Z Zuzanną rozmawiamy dość często o tym, czy potrzebują jakiejś pomocy z mojej strony.

Trochę się teraz zakręciłem, ale chodzi o to, [01:32:00] że poznałem ludzi z Pathwaya tutaj, w Polsce. Później mieliśmy spotkanie, na którym poznałem całą ekipę. Niesamowici ludzie: założyciel Naszej Klasy, programiści, którzy wygrywali konkursy w programowaniu algorytmicznym. Generalnie nie rozumiałem, co oni mówią. Zwłaszcza Adrian i Janek. Skomplikowane rzeczy.

Zaczęli pracować nad architekturą i w pewnym momencie Adrian napisał do mnie, czy chciałbym z nimi porozmawiać o tej nowej architekturze. To model rekurencyjny, w którym reasoning odbywa się w latent state. Model myśli rekurencyjnie, ale nie wypowiadając tego — rozumuje w ukrytej przestrzeni. [01:33:00]

Karol: Zastanawia się.

Remek: Tak. Zastanawia się, rekurencyjnie przetwarza swoje myśli, doskonali je.

Adrian napisał: „Słuchaj, mam publikację, przyjadę do ciebie”. Ja mówię: „To spotkajmy się, pogadajmy gdzieś na telko”. On mówi: „Nie, nie. Chciałbym przyjechać do ciebie do Polski, żebyśmy pogadali”.

Pamiętam, że umawialiśmy się z Adrianem na spotkanie w połowie drogi między Wrocławiem a Warszawą i wyszedł nam Toruń. Ponieważ mieszkam w Toruniu i w Warszawie, w dwóch miastach, stwierdziłem, że spotkam Adriana w Toruniu.

Adrian przyjechał do mnie z pierwszą wersją publikacji o BDH, o tym modelu nowej architektury wymyślonej przez Pathway. Przez cały dzień pokazywał mi ten [01:34:00] paper i przechodził przez niego krok po kroku. Widziałem niesamowity błysk w oku Adriana. Że wymyślił genialną rzecz i naprawdę wierzy, że to coś przełomowego.

Spędziliśmy cały dzień na omawianiu tej architektury. Początkowo pomagałem stworzyć pipeline do uczenia tego modelu RL-owego, ale nasze drogi chwilowo się rozeszły, bo zacząłem pracować w Ingenixie i większość czasu poświęcałem już tej firmie.

Cały czas utrzymywaliśmy kontakt, ale bardziej prywatnie. Byłem już poza ekipą Pathwaya. I dwa czy trzy tygodnie temu Zuza do mnie napisała: „Słuchaj, mamy najnowszy model. [01:35:00] Chciałbyś sprawdzić, jak chodzi?”.

Ten model udostępniono mi przez API, bo jestem poza ekipą Pathwaya, więc nie widzę architektury. Nie dostałem go w kodzie, tylko przez API. Zuza mówi: „To przetestuj. Mamy taką hipotezę — na razie testujemy na jednym zadaniu — że ten model jest przy ARC-AGI całkiem niezły, a koszt inferencji jest bardzo niski”. Bo to nadal prototypowe rozwiązanie, prototypowa architektura. Idziemy w to, żeby stworzyć model reasoningowy, ale o niewielkim koszcie.

Karol: Przypomnisz proporcje?

Remek: Wiesz co, nawet nie pamiętam.

Karol: Jeden dolar do ilu?

Remek: Nie pamiętam. [01:36:00] Nie odpowiem ci na to pytanie. Trzeba skierować się do bloga Pathwaya.

Mówię: „Dobra, przetestuję”. Dostałem to API. Tylko że jak je dostałem, to stwierdziłem: co ja Zuzie napiszę? Że ten benchmark chodzi albo nie chodzi? Bez sensu. Jak zapyta mnie o feedback, to co ja napiszę — dobrze albo źle? Mówię: „Muszę do tego podejść bardziej naukowo”. Tym bardziej że bardzo ich lubię, więc muszą mieć ze mnie korzyść.

Wbiłem to sobie do głowy i doszedłem do wniosku, że sprawdzę na zadaniach ARC-AGI, a do tego dorobię zadania, których nie było widać nawet w zbiorze treningowym. Utworzę dodatkowy zbiór testowy, blinded, którego oni nie widzieli. Ale jak zacząłem o tym myśleć, stwierdziłem, że [01:37:00] chciałbym zobaczyć, jakich koncepcji ten model nie rozumie.

ARC-AGI to benchmark, który wykorzystuje pewne koncepcje: myślenia przestrzennego, abstrakcyjnego. Fajnie byłoby zwrócić im informację, że pewne koncepcje ten model rozumie bardzo dobrze, a pewnych nie rozumie. Zebraliśmy tych koncepcji chyba dwanaście, zgodnie z ARC Concept.

Przetestowałem model pod kątem rozumienia koncepcji, czyli powiedziałbym: semantyki. Zuza napisała, że super, że oni to ode mnie biorą i bardzo im się to [01:38:00] podoba. I tak w sumie przypadkowo stałem się współautorem.

Mój dorobek jest tam bardzo niewielki, bo nie jestem twórcą tej koncepcji ani tego modelu. Chciałem tylko dać wartość dodaną, żeby firma badawcza, która tworzy coś konkretnego, zyskała ode mnie coś, co będzie mogła wykorzystać i zobaczyć, jak ten model funkcjonuje.

Jestem z tego naprawdę dumny, bo to świetne podejście. Mamy kogoś, kto stara się wyjść poza tę klatkę transformerową. Kto myśli: okej, transformer jest w porządku, bardzo z niego korzystamy we wszystkich albo większości modeli. Ale co jest za transformerem? Post-transformer architecture. [01:39:00] Stałem się więc dumnym przedostatnim autorem wśród naprawdę niesamowitych ludzi.

Nadal utrzymujemy kontakt. Zuza już do mnie pisała, że jak będzie nowa wersja, to API zostanie udostępnione. A ja już myślę o tym, co zrobić, żeby znowu dać tę wartość i tę informację zwrotną. Tak wygląda historia współpracy z Pathwayem. Mam nadzieję, że w październiku — wybieram się do Stanów, będę pewnie w Palo Alto — też ich odwiedzę. Umówimy się na kawę i będziemy rozmawiać o nowych koncepcjach.

Karol: Rozmawialiśmy o eksperymentowaniu i o tym, żeby wziąć w ręce to, czego się uczysz. Żeby nie pozostawiać wiedzy wyłącznie w sferze teorii. Pisałem kiedyś tekst o testowaniu i nazwałem to brudzeniem rąk własną niewiedzą. Chodzi o wyciąganie wniosków — i o to, że coś, co na początku wydaje się trudne, z czasem staje się łatwe. Ty chyba też tak robisz.

Remek: Wydaje mi się, że największym problemem ludzi — a przynajmniej największym problemem w pracy intelektualnej — jest niezauważanie braku własnej wiedzy. Nieświadomość poziomu własnej niekompetencji. [01:42:00]

Kiedy patrzę na siebie, to wydaje mi się, że kiedyś wiedziałem więcej. Albo raczej: byłem bardziej pewny, że wszystko wiem. Coś się działo, a ja mówiłem: „Tak, to na pewno działa”. Dzisiaj jest tak, że im więcej wiem i im więcej doświadczyłem, tym mniej wiem. Po prostu.

Mam więcej pytań niż odpowiedzi. Kiedy dzisiaj podchodzę do eksperymentów AI-owych, podchodzę z czystą głową i z niesamowitym dystansem do tego, przed czym stoję. Staram się nie zakładać. Albo inaczej: podchodzę z [01:43:00] pokorą do problemu.

Dużym problemem w zdobywaniu wiedzy jest to, że ludziom się wydaje, że wiedzą. Są o czymś przekonani, ale nie mają samoświadomości własnej niekompetencji. To główna przeszkoda w budowaniu kompetencji — zakładanie pewnych rzeczy z góry.

Dobrze jest zawsze zadać pytanie: „Ale skąd to wiesz?”. Jak ktoś coś twierdzi, to okej — poproszę konkretne dowody na dane twierdzenie.

Umiejętność pogodzenia się z tym, że jesteśmy niekompetentni, to pierwszy krok. Jak przy wychodzeniu z alkoholizmu: przyznanie się, że człowiek jest od czegoś uzależniony. [01:44:00] Powiedzenie sobie: „Okej, dużo nie wiem, naprawdę dużo nie wiem”.

I potem starać się zrozumieć, jaka jest domena tego problemu, przed czym stoimy. Zadawać dużo pytań. Uczyć się tego problemu i tego, jak go rozwiązać. Ale nie zakładać z góry.

Bardzo często widzę na portalach społecznościowych, że wszyscy wszystko wiedzą, zwłaszcza w komentarzach. A osoby, które przeszły bardzo dużo doświadczeń, mnóstwo eksperymentów, widzą bardzo szybko ten poziom kompetencji czy niekompetencji. Widzą, że to wypowiedź pochodząca z urywka [01:45:00] kontekstu.

Karol: Gary Vaynerchuk, którego bardzo cenię, jeżeli chodzi o podejście do tworzenia treści i patrzenie na cały świat social mediów, ma takie powiedzenie: „Document, don’t create”. Ty chyba jesteś świetnym przykładem człowieka, który po pierwsze z radością na twarzy mówi-

Remek: Raczej nie wiem.

Karol: A po drugie, w tak fajny sposób dzielisz się swoimi eksperymentami i dokumentujesz je — chociażby przy okazji publikacji każdego najnowszego modelu. Kiedy tworzysz ten model świata, taki z… Ja już też jestem zmęczony.

Remek: To jest chain reaction.

Karol: Chain reaction. Reakcja łańcuchowa.

Remek: Tak. To zabawkowy [01:46:00] przykład, który pokazuje ogromną odległość między modelami. Jest ChatGPT, który realizuje to zadanie bez problemu, i jest cała masa różnych modeli, przy których absolutnie widać, czy dany model jest w stanie stworzyć świat opisany jako reakcja łańcuchowa. Mamy kilka elementów i one mają się połączyć, żeby zrealizować wspólny cel.

Tym zabawkowym przykładem sprawdzamy dwie rzeczy. Po pierwsze, czy model, mając wolną rękę, bez podpowiedzi człowieka, jest w stanie zrealizować to zadanie. Po drugie, czy jest w stanie zrozumieć, co w ogóle robi. Czy rozumie, że stoją za tym pewne prawa i fizyka.

Remek: Chodzi o to, żeby nie tylko odtworzył, [01:47:00] ale też rozumiał, co robi. Widać, że niektóre modele odtwarzają całkowicie, ale się gubią — mimo że mają pełną dowolność w realizacji tego zadania i są przez wielkie laboratoria ogłaszane jako topowe modele do kodowania.

Nie trzeba więc wielkich benchmarków, żeby sprawdzić model. Wystarczy jeden przykład, żeby mniej więcej określić, gdzie ten model naprawdę jest w szeregu. Co nie oznacza, że modele, które nie realizują tego zadania, są złe. To znaczy tylko tyle, że być może-

Karol: Nie są do tego przeznaczone.

Remek: Tak. Być może w innych zadaniach są bardzo dobre.

Ale jest tu pułapka. Pokazuję dzisiaj świeży przykład: najnowszy model GLM 5.3 od Z.ai, który okrzyknięto hitem ostatnich dni. Że to hit, który będzie [01:48:00] walczył z GPT. Model open source, otwarty, tani. A wygenerowanie przykładu realizującego to zadanie kosztowało chyba trzydzieści osiem dolarów. GPT robi to za dziewięć.

GPT robi to w osiemnaście minut. Tamten model — w sto osiemdziesiąt trzy minuty. Ze statystyk widzę przy tym, że czas odpowiedzi GLM-a z OpenRoutera jest krótszy niż GPT. Ten model miał więc fory, bo był szybszy. A zrealizował zadanie gorzej.

To pułapka, w którą się łapiemy. Nie kupimy modelu GPT, będziemy korzystać z open source’u, na przykład z chińskiego modelu do kodowania, bo chcemy mieć tanio. [01:49:00] A okazuje się, że te modele potrzebują wygenerować o wiele więcej tokenów. Nie rozumieją.

Muszą wykonać o wiele więcej tool calls. GPT wykonał ponad dwadzieścia wywołań narzędzi, a GLM 5.3 ponad trzysta. To właśnie różnica klas między modelami. Widać na tym bardzo prostym teście, gdzie jest technologia, kompetencja i wiedza, a gdzie jest samo tworzenie modeli.

Dla mnie technologicznie OpenAI jest o wiele bardziej zaawansowane niż-

Karol: Niż Chiny.

Remek: Niż dzisiaj Chiny. Mimo że Chiny pokazują pewne wynalazki, pewne metody, które poprawiają jakość tych modeli. Ale są jeszcze daleko za frontier labs.

Taki prosty test: [01:50:00] daję modelowi zadanie do wykonania i patrzę, jaki będzie rezultat. Te rezultaty są coraz lepsze, czyli modele się poprawiają.

Planuję podejście do tego testu w wersji dwa zero, bo prawdopodobnie ktoś to podpatrzy i za chwilę będzie trenował modele pod takie zadania. Staram się więc wymyślić kolejne proste zadanie, które pokaże różnicę między modelami. Nie tworzę skomplikowanego benchmarku. Chcę pokazać ludziom, że po pierwsze koszt może być większy, a po drugie te modele nie są aż tak super hiper.

Karol: Ciekawe, czy fizyka jest trudniejsza niż ludzkie emocje.

Remek: Czy fizyka jest trudniejsza niż ludzkie emocje? [01:51:00]

Karol: Albo niż ludzkie zachowania.

Remek: Trudno powiedzieć. Idziemy tu w kierunku pytania, czy tam są jakieś emocje. To tematy związane z tym, czym są takie modele. Czy one myślą, czy rozumują, czy modelują jakieś rozumowanie.

Powiem tak: jestem dzisiaj przeciwnikiem pójścia w te kierunki, bo niewiele wiemy na ten temat. Natomiast powiedziałem kiedyś i wydaje mi się, że tak może być, że dzięki AI poznamy to, jak funkcjonuje człowiek i jak funkcjonuje mózg. Jak funkcjonują emocje. [01:52:00] Co znaczy inteligencja, co znaczy świadomość.

To paradoks: bardzo dużo wkładamy teraz w uczenie modeli i staramy się modelować je na podobieństwo tego, jak funkcjonuje ludzki mózg.

Część ludzi mówi, że to w ogóle nie przypomina mózgu. Moim zdaniem to nieprawda. Jeżeli patrzymy na rozwój sieci neuronowych i na jeden perceptron, to rzeczywiście jest to bardzo zgrubne przybliżenie tego, jak mamy zamodelowany mózg. Ale musimy patrzeć przez pryzmat tego, że dzisiaj nie mamy modelu jednego perceptronu ani nawet połączenia perceptronów. To już dość skomplikowane mechanizmy.

Mówimy o mechanizmach [01:53:00] atencji. Mówimy o mechanizmach pamięciowych, o mechanizmach rekurencyjnych. Mówimy o pamięci krótkotrwałej, czyli o kontekście i modelowaniu kontekstu. O pamięci długoterminowej, czyli o systemach agentowych i o tym, że potrafią zapamiętywać rzeczy i uczyć się nas.

Jesteśmy więc bardzo blisko tych elementów składowych tego, jak funkcjonuje nasza głowa. Tyle że w komputerze zamodelowano je inaczej, bo pracują w innym środowisku. Nigdy nie będzie tak jak w przyrodzie. Ale pytanie, czy tak musi być. Czy musimy koniecznie dążyć do całkowitego odwzorowania tego, co jest w naszej głowie, żeby uzyskać [01:54:00] poziom — w cudzysłowie — „świadomości” czy superintelligence. Moim zdaniem niekoniecznie.

Karol: A kiedy pracujesz, kiedy masz rozkminy nad różnymi tematami, to funkcjonuje u ciebie coś takiego jak intuicja? Czy raczej wszystko jest logiką i rozumowaniem?

Remek: Intuicja pochodzi moim zdaniem z doświadczeń. U mnie chyba jest jej bardzo dużo. Niektóre rzeczy po prostu czuję. Nie jestem w stanie wyjaśnić, skąd wiem.

Natomiast proces [01:55:00] badawczy wymaga ode mnie dowodów. Jeżeli idę na spotkanie i powiem, że wydaje mi się, że tak jest, to jest to co najwyżej hipoteza. Którą staramy się przekuć w proces badawczy.

Mam jakąś intuicję, że coś nie będzie działać. Wielokrotnie, dużo wcześniej, zanim ktoś spróbował, już wiedziałem, że to nie będzie działać. Nie miałem dowodu, dlaczego. Ale czułem, że to nie jest ten kierunek. I to sprawdzaliśmy.

Ta intuicja gdzieś jest i wydaje mi się, że bierze się właśnie z modelu świata. Mam gdzieś w głowie zbudowany model świata, który nie funkcjonuje na takim poziomie, żebym był w stanie to wyartykułować i od razu powiedzieć: to jest to i to. Tylko [01:56:00] gdzieś czuję, że tak jest.

Karol: Z tyłu głowy.

Remek: Tak. I pytanie, czy AI też tak myśli.

Karol: To była konsekwencja mojego pytania. Teraz pytanie, czy maszyna będzie mogła działać na zasadzie intuicji.

Remek: Wydaje mi się, że w dzisiejszych modelach, czyli w transformerach, ta intuicja nie istnieje. Reasoning modeli jest dziś dość mechaniczną czynnością. Model [01:57:00] stara się wygenerować po prostu jak najdłuższy kontekst, bo tak działają mechanizmy atencyjne.

To taki trik: mamy jakieś pytanie, a model stara się je rozwinąć. Mówimy, że to proces myślowy modelu, ale on jest po prostu generowany. To dziś model statystyczny. Chociaż — tu Andrzej [Dragan] by powiedział — w głowie też mamy właściwie model statystyczny.

Czym się to więc różni? Różni się tym, że model AI nie jest w stanie-

Karol: Wziąć czegoś z niczego.

Remek: Przewidzieć [01:58:00] konsekwencji swoich działań bez wykonania czynności. Weźmy taki przypadek: stoimy na moście i myślimy, co będzie, jeżeli z niego skoczymy. My nie musimy skakać, żeby przewidzieć pełne konsekwencje tego, że ktoś skoczy. A model, żeby zrozumieć konsekwencje, musi wykonać dużą pracę.

Model nie jest więc w stanie planować czynności od samego początku. My możemy siedzieć dzisiaj w studiu i zaplanować wszystko bez wykonywania czynności. A model musi zrobić pracę, zrobić reasoning, wygenerować, spalić dużo energii, [01:59:00] żeby podjąć kolejny krok. Taka jest różnica między nami.

My siedzimy i myślimy obrazami. Możemy zamknąć oczy i wyobrazić sobie, że jesteśmy w Filadelfii na dużym moście samobójców, po którym cały czas jeździ policja na rowerze i sprawdza, czy ktoś nie próbuje. Jesteśmy w stanie usiąść i wyobrazić sobie takie czarne scenariusze. Co by było, gdyby? I wyciągnąć konsekwencje.

Co by było, gdybyśmy przebiegli na drugą stronę tego mostu? Wszyscy mówią, żeby nie przebiegać, bo można wbiec do tej dzielnicy i już nie wybiec. Zauważ, że my nie musimy wykonać tej pracy. Model językowy musiałby tam przebiec i dopiero wtedy by się przekonał, czy wróci, czy nie.

Z jednej strony jest więc dużo podobieństw, ale z drugiej mechanizmy działania są dziś zupełnie inne.

Karol: Chyba że czytał książkę o tym moście. [02:00:00]

Remek: Ale on nadal musi to zwerbalizować. Jeżeli zadasz mu pytanie, to musi wykonać pracę, żeby to sobie wyobrazić. Wydaje mi się więc, że te różnice są dość duże.

Być może modele, które robi teraz na przykład Pathway — modele reasoningowe w przestrzeniach latentnych — to jest ten mechanizm, który my mamy. Nie musi nic werbalizować, wykonuje pracę wewnętrznie-

Karol: W mgnieniu oka.

Remek: Ale wewnętrznie. I na końcu daje odpowiedź. Natomiast ten czas pracy jest długi w porównaniu z tym, jak my zamykamy oczy i widzimy konsekwencje.

Dość skomplikowanie to chyba wyjaśniłem. Ale są różnice między [02:01:00] naszą świadomością a świadomością — że tak powiem — modelu.

Karol: Remku, to była ogromna przyjemność móc spędzić z tobą prawie dwie godziny, rozmawiając o przeróżnych rzeczach. Dziękuję ci serdecznie za to, że przez te dwie godziny uśmiech nie schodził ci z twarzy, bo mówiłeś o rzeczach dla ciebie ważnych. Teraz rozumiem, skąd ta pasja do tworzenia, eksperymentowania i obracania w ręku różnych koncepcji.

Remek: Ja też dziękuję. Zawsze oglądałem u ciebie tę koncepcję dziewięćdziesięciu dziewięciu twarzy AI. Pamiętam, że umawialiśmy się gdzieś przy dwudziestej twarzy, a może nawet wcześniej. Bardzo mi więc miło, że trafiłem do grona osób zaproszonych do tego podcastu. Dałeś mi ogromną przestrzeń do tego, żeby opowiadać. Dzięki wielkie za zaproszenie.

Karol: Trzymam kciuki za wasze dalsze odkrycia.

Remek: Dzięki wielkie.