Újdonságok, nyitott kérdések, kötetlen beszélgetés
A workshop óta
AI Safety Atlas
· nyílt tankönyv (képességek, kockázatok, irányítás, értékelések)
Dupoux · LeCun · Malik (2026) · arXiv:2603.15381 · autonóm tanulás: A / B / M rendszerek
Frontier modellek (2026. március)
Nincs egyetlen „nyertes” minden benchmarkon; a
gyártók számai eltérnek. Feladat, költség és szabályzat szerint válasszatok.
Anthropic · Claude Opus 4.6 (2026. febr.) · a család legmélyebb vonala nehéz, ügynök-jellegű /
kódolási munkára · Claude Sonnet 4.6 (2026. febr.) · a claude.ai Free és Pro alapértelmezett modellje, jó
ár / teljesítmény arány
OpenAI · GPT-5.4 család (2026. márc.) · Instant / Thinking / Pro: sebesség kontra mélység
Google · Gemini 3.1 Pro (2026. febr.) · hosszú kontextus, multimodális, erős
érveléses teszteken versenyképes
METR
Model Evaluation & Threat Research ·
nonprofit, Berkeley · metr.org
A frontier képességeket és az autonóm feladat-időtávok bővülését méri
Bevezetés előtti értékeléseken dolgozik együtt laborokkal; publikál mérési és kockázati
kutatást
Oktatói szemmel: a képességeket mérik és vitatják, nem csak marketing állítások vannak
Aktuális trendek
Ügynökök · több lépés, eszköz · felügyelet, szivárgás
Inferencia idejű „gondolkodás” · nehezebb feladaton jobb · drágább, lassabb
AI Act · GPAI · intézményi szabályok alakulnak
Oktatás · szillabusz, folyamat alapú értékelés
GPAI
(general-purpose AI): EU szerinti sokfeladatos alapmodell · külön kötelezettségek (dokumentáció,
magas kockázat).
MI-biztonság
Nem csak „sci-fi kockázat”: visszaélés, robusztusság, torzítás, környezeti költség
Az Atlas fejezetei összekapcsolják az irányítást és a technikai enyhítéseket
MOME szempontból: hallgatói bizalom, szellemi tulajdon, valós készségfejlesztés
A / B / M rendszerek
Rész
Szerep
A rendszer
Tanulás megfigyelésből
B rendszer
Tanulás aktív cselekvésből
M rendszer
Meta-irányítás: váltás A és B között
Kutatási irány · a mai chatbotok többnyire tanítás után „fagynak
be”, az ember irányítja adattal, prompttal, eszközzel.