Refresh the page

Megérkezett a GPT-6 Astra. Az új ChatGPT jobban tudja kezelni a számítógépet, és a hackelés terén akár egy biztonsági szakértő helyébe is léphet

Article

• Szerző: Peter Vnuk

Amikor az OpenAI 2026. szeptember 3-án bemutatta a GPT-6 Astrát, az újdonságon nem a benchmark-pontszámok újabb javulása volt a legérdekesebb, hanem az a szemléletváltás, ahogyan a mesterséges intelligencia a valódi munkavégzés során működik. Az új modell sokkal jobban képes kezelni a számítógépes környezetet, további eszközöket használni és egymásra épülő lépések hosszabb láncolatait végrehajtani, így a ChatGPT egyre gyakrabban tudja átvenni magának a feladatnak egy részét, ahelyett hogy csupán leírná a felhasználónak a teendőket.

Megérkezett a GPT-6 Astra – cikk

Megérkezett a GPT-6 Astra – TARTALOM

  1. A számítógép-vezérlés a legnagyobb fejlődések egyike
  2. Az egymilliót meghaladó kontextusablak a nagyobb projekteknél segít
  3. A 99,9%-os rekorderedmény az absztrakt feladatokban egy fontos megkötéssel jár
  4. Magáról a modellről rengeteg adat továbbra is titokban marad
  5. A GPT-6 Astra kevesebb hibát vét, a jobb képességek azonban növelik a kockázatokat
  6. Mikor jelenik meg a GPT-6 a ChatGPT-ben?

A gyakorlatban az Astra képes böngészni a weben, fájlokkal dolgozni, űrlapokat kitölteni, adatokat elemezni, dokumentumokat készíteni vagy weboldalakat szerkeszteni. Összetettebb feladatoknál több eszközt kombinál, menet közben kiértékeli az eredményeket, és azok alapján módosítja a további lépéseket – pontosan ez az a munkamódszer, amelyre az úgynevezett AI-ágensek jelenlegi generációja épül.

A közzétett eredmények szerint éppen a több percig vagy akár több tíz percig tartó feladatoknál kezd a legjobban megmutatkozni a különbség az előző generációhoz képest. Egyetlen prompt és egyetlen válasz helyett egyre inkább egy hosszabb folyamatról van szó, amelynek során a modell tervez, végrehajtja az egyes lépéseket, és ellenőrzi, hogy valóban eljutott-e a kívánt eredményhez.

A számítógép-vezérlés a legnagyobb fejlődések egyike

A fejlődés különösen jól látható a grafikus felhasználói felülettel végzett munkát vizsgáló tesztekben, ahol az Astra lényegesen jobb eredményeket ér el, mint a GPT-5.6 Sol. Az OSWorld 2.0 benchmarkban 72,6%-ot ért el az előd 65,7%-ával szemben, a felhasználói felületen való tájékozódást vizsgáló ScreenSpot-Pro tesztben pedig az eredmény 76,9%-ról 92,7%-ra ugrott.

Érdekes adat az OSWorld feladatainak teljesítéséhez szükséges idő is, mivel az OpenAI szerint az Astra esetében ez nagyjából 40 perc, szemben a GPT-5.6 Sol körülbelül 75 percével. Ez persze nem a ChatGPT-ben adott hétköznapi válaszok sebességét jelenti, hanem számos lépésből és más eszközökkel való interakcióból álló összetett munkafolyamatokra vonatkozik.

Hasonlóan markáns javulás tapasztalható a programozás és a rendszerüzemeltetés terén is. A Terminal-Bench 4.0 eredménye 37,3%-ról 57,9%-ra, az SRE-Bench pedig 55,9%-ról 88%-ra ugrott, miközben egyes hagyományos tudásfelmérő teszteknél a növekedésre már jóval kevesebb tér maradt. A GPQA Diamond esetében például az eredmény mindössze 94,6%-ról 96%-ra emelkedett.

Teszt GPT-5.6 Sol GPT-6 Astra
OSWorld 2.0 65,7 % 72,6 %
ScreenSpot-Pro 76,9 % 92,7 %
Terminal-Bench 4.0 37,3 % 57,9 %
SRE-Bench 55,9 % 88,0 %
MRCR 512K–1M 73,8 % 96,3 %

Ezekből az eredményekből elég jól kirajzolódik az új generáció fókusza, mivel az Astra a legnagyobb előnyt a tervezést, a számítógépes környezettel való munkát és több eszköz egyidejű használatát igénylő feladatoknál szerzi. Egyszerű kérdéseknél ezért a generációs különbség korántsem biztos, hogy ennyire szembetűnő.

Az egymilliót meghaladó kontextusablak a nagyobb projekteknél segít

Kiterjedt dokumentumokkal való munka során fontos szerepet játszhat az új, 1,05 millió tokenes kontextusablak is. Ennek köszönhetően a modell egyetlen feladat során képes nagyon hosszú dokumentációval, nagyobb mennyiségű fájllal vagy terjedelmes forráskóddal dolgozni anélkül, hogy mindent sok különálló beszélgetésre kellene bontani.

A kontextus puszta mérete persze nem sokat érne, ha a modell a hatalmas adatmennyiségben fokozatosan elveszne. Az MRCR tesztben az 512 ezer és egymillió token közötti tartományban az Astra 96,3%-ot ért el, míg a GPT-5.6 Sol 73,8%-on végzett, így éppen a nagy projektekkel való munka lehet az a terület, ahol az új modell a gyakorlatban a legmeggyőzőbb.

Az API-n keresztül a GPT-6 Astra szöveget és képeket egyaránt fogad, további eszközökön keresztül pedig hozzáfér például a webes kereséshez, fájlokhoz, kódfuttatáshoz, képgeneráláshoz vagy a számítógép vezérléséhez. Maga a modell továbbra is a felhőben fut, és az OpenAI egyelőre nem kínálja nyilvánosan elérhető súlyait laptopon vagy asztali gépen történő helyi futtatáshoz.

A 99,9%-os rekorderedmény az absztrakt feladatokban egy fontos megkötéssel jár

Az Astra bemutatása után az egyik leggyakrabban idézett szám a 99,9%-os eredmény volt az ARC-AGI-3 benchmarkban, amely az új, absztrakt feladatok megoldási képességét teszteli. Ez a magas eredmény azonban az OpenAI egy speciális adaptere segítségével jött létre, amely az egyes kérések között megőrzi a korábbi gondolkodás állapotát, és lehetővé teszi a rendszer számára, hogy újra felhasználja a már elvégzett munkát.

i

Validated AI: előre tesztelt AI-konfigurációk valós működéshez

Standard tesztelési módszerrel az Astra 62,7%-ot ért el, tehát a két érték meglehetősen eltérő körülményeket ír le. A kettő közötti különbség viszont jól mutatja, hogy manapság a modell mellett mekkora szerepet játszik a memória, az orkesztráció és az elérhető eszközkészlet. A mindennapi használat szempontjából ez talán fontosabb információ, mint maga a rekord, hiszen egy AI-ágens éles környezetben sem izolált modellként működik. A végső minőség egyre inkább attól függ, milyen adatokhoz fér hozzá, mit tud megőrizni a korábbi lépésekből, és milyen műveleteket enged neki végrehajtani az alkalmazás.

Azt is ebben a kontextusban kell értelmezni, hogy az Astrát az OpenAI legokosabb modelljeként emlegetik. Egyes átfogó, független benchmarkokban ugyanis az Anthropic konkurens modelljei továbbra is magasabb pontszámot érnek el, így a jelenlegi AI abszolút győztesét egyetlen számmal nem lehet meghatározni.

QR-olvasó az Alza.hu alkalmazásban
Az ARC-AGI-3 azt teszteli, hogy az ágensek mennyire képesek tanulni ismeretlen interaktív feladatok megoldása közben. A GPT-6 Astra 99,9%-os eredményt ért el, míg az emberek átlaga 48% volt. A teszt a Responses API-t használó környezetben zajlott, amely megőrzi a korábbi gondolkodást és üzeneteket; ugyanezen beállítások mellett az OpenAI a Sol modell teljesítményét körülbelül 30%-ra becsüli. Forrás: openai.com/index/gpt-6-astra/.
3D modell megjelenítése térben
A Terminal-Bench Science 0.1 az ágensek azon képességét értékeli, hogy tudományos feladatokat hajtsanak végre kód és termináleszközök segítségével. A GPT-6 Astra 64,6%-ot ért el a Claude Fable 5.1 52,6%-ával szemben, miközben az API-költségek nagyjából 31%-kal alacsonyabbak voltak. Olcsóbb üzemmódban az Astra 61,1%-ot szerzett, míg a GPT-5.6 Sol 22,4%-ot. Forrás: openai.com/index/gpt-6-astra/.

Magáról a modellről rengeteg adat továbbra is titokban marad

Bár az OpenAI viszonylag részletes teszteredményeket és műszaki paramétereket hozott nyilvánosságra, magának a neurális hálózatnak a belső felépítéséről még mindig keveset tudunk. A cég nem közli a paraméterek számát, a rétegek számát, és azt sem, hogy az Astra például Mixture of Experts architektúrát használ-e, így a modell méretére vonatkozó konkrét becslések továbbra is találgatások maradnak.

Nyilvánosan legalább annyi ismert, hogy a beépített tudás határa 2026. április 30., frissebb információkat pedig a modell webes kereséssel és egyéb csatlakoztatott forrásokból szerezhet. Az OpenAI azt is megerősíti, hogy reinforcement learninget és más, a következtetésre és biztonságosabb viselkedésre irányuló módszereket alkalmaz, a post-training pontos receptjét azonban nem hozta nyilvánosságra.

A GPT-6 Astra kevesebb hibát vét, a jobb képességek azonban növelik a kockázatokat

Az új generáció egyik legkellemesebb eredménye a hallucinációk csökkenése, amely az OpenAI belső tesztjében a GPT-5.6 Sol 12,2%-áról az Astra esetében 4,2%-ra esett vissza. A nagyobb megbízhatóság a mindennapi információkezelés során is megmutatkozhat, ennek ellenére továbbra is fontos különbséget tenni aközött, amit a modell a tanítás során sajátított el, és az olyan adatok között, amelyek folyamatosan változnak.

GPT-6 Astra megérkezett, cikk
A felhasználói felületen való navigálásban a GPT-6 Astra jelentősen jobb, mint a korábbi GPT-5.6 Sol.

Például a raktárkészlet, a termék ára, a rendelés állapota vagy a szállítási határidő aktuális adatbázisból kell, hogy származzon, amelyhez az AI eszközök révén férhet hozzá. Az Astra erőssége abban rejlik, hogy az ilyen forrásokkal jobban tud dolgozni, kombinálni őket, és a kapott információkat érthető eredménnyé alakítani.

A valós műveletek végrehajtására való növekvő képességgel azonban a biztonsági korlátozások jelentősége is nő. A GPT-6 Astra az OpenAI első olyan modellje, amely a cég Preparedness Frameworkje szerint a kibernetikai képességek terén elérte a Critical szintet. Ez a szint azt jelenti, hogy a modell a fejlesztők értékelése szerint megfelelő eszközökkel már önállóan képes eddig ismeretlen biztonsági réseket keresni és azok kihasználási módján dolgozni – vagyis olyan feladatokat ellátni, amelyekhez eddig magasan képzett biztonsági szakértőkre volt szükség.

i

AI-ügynökök és automatizálás a gyakorlatban: a tesztfázistól az éles üzemig

Éppen ezek miatt a képességek miatt az OpenAI a fejlett funkciók egy részét a nyilvánosan elérhető verzióban korlátozza, a biztonsági szakemberek számára pedig a Daybreak programon keresztül, szigorúbb feltételek mellett biztosít bővített hozzáférést. Minél önállóbban képes tehát az AI a számítógéppel dolgozni, annál fontosabbak azok a szabályok, amelyek meghatározzák, mit tehet automatikusan, és mihez kell már emberi jóváhagyás.

Mikor jelenik meg a GPT-6 a ChatGPT-ben?

A GPT-6 Astra elérhetővé tétele szeptember 3-án kezdődött a hivatalos bemutatóval egyidejűleg, és fokozatosan terjed ki a ChatGPT Plus, Pro, Business és Enterprise előfizetőire. A fejlesztők az OpenAI API-n, a Microsoft Foundryn és az AWS Bedrockon keresztül is hozzáférnek a modellhez. Mivel a bevezetés szakaszosan zajlik, szeptember 4-én még nem minden előfizető számára volt elérhető az új modell. Az OpenAI egyébként nem jelentett be külön időpontot Magyarországra vonatkozóan, így ha az Astra egyelőre nem jelenik meg a modellek között, az nem feltétlenül jelent regionális korlátozást vagy fiókproblémát.

A hétköznapi felhasználók számára a cég nem mutatott be kizárólag a GPT-6-ra vonatkozó külön előfizetést, a fejlesztők viszont már ismerik az API árazását. A standard díjszabás egymillió bemeneti tokenre 10 dollár, egymillió kimeneti tokenre pedig 50 dollár, ami jóval több, mint az alap GPT-5 1,25 és 10 dolláros ára. A magasabb ár valószínűleg ahhoz vezet, hogy az Astrát főként összetettebb feladatokhoz használják majd, ahol a jobb tervezésnek és eszközhasználatnak köszönhetően további lépéseket vagy emberi munkát tud megspórolni. Egyszerű kérdésekhez és rövid szöveges feladatokhoz az olcsóbb modellek továbbra is praktikusabbak maradnak.

Összegzés

A GPT-6 Astra megjelenésével a ChatGPT továbbfejlesztésének súlypontja egyre határozottabban a hosszabb önálló munkát igénylő feladatok felé tolódik. A legnagyobb fejlődés a számítógép-vezérlés, a programozás, a terjedelmes dokumentumokkal való munka és a különféle eszközök használata terén mutatkozik – vagyis pontosan azokon a területeken, amelyek a jobb képességű AI-ügynökökhöz szükségesek. A hétköznapi felhasználó számára ezért nem feltétlenül egy újabb rekord-benchmarkeredmény jelenti a legnagyobb előnyt, hanem az a helyzet, amikor tanácsok sorozata helyett egyből kész eredményt kap. Éppen ez a képesség – a feladatkijelöléstől több egymásra épülő lépésen át az elkészült munkáig eljutni AI-ügynökként – lesz valószínűleg a fő különbség a mai chatbotok és a mesterséges intelligencia eszközök következő generációja között.

i Ezek a cikkek is érdekelhetnek:
Peter Vnuk

Peter Vnuk

A technológia egyszerre munka és szórakozás számomra - leginkább az okostelefonok, laptopok, audio, mesterséges intelligencia és minden más hi-tech dolog érdekel. Szeretem áttekinteni a híreket, követni a futurisztikus trendeket és megjósolni a technológia következő fejleményeit. Lenyűgöznek a sci-fik és a jövő világáról szóló víziók, amelyek gyakran valódi technológiai fejlesztéseket inspirálnak. Szakmailag is foglalkozom videojátékokkal és a játékiparral. Amikor nem dolgozom, szeretek kikapcsolódni egy jó játékkal, egy jó sörrel, vagy tech-mémek készítésével a Facebookon.

Try our cookies

Alza.cz a. s., Company identification number 27082440, use cookies and other data to ensure the proper functioning of the website and, with your consent, also, among other things, to personalize advertising and the content of our websites. By clicking on the “I understand“ button, you agree to the use of cookies and the transfer of data regarding the behavior on the website for displaying targeted advertising on social networks and advertising networks on other websites.

More information
I understand Detailed settings Reject everything
P-DC1-WEB30