AI-tananyagok
Vissza az AI-tananyagokhoz

A veszteség­függvény

Hogyan mérjük a modell hibáját, és hogyan irányítja ez a mérce a tanulást? A veszteség az a szám, amelyből a modell tanul, és amely nagyban meghatározza, mit tanul meg.

8 szint · kb. 4 óra · középhaladó. A lakásárbecsléstől a nagy nyelvi modellek finomhangolásáig. Minden szint három mélységben olvasható, és kvízzel zárul: a következő szint 3-ból 2 helyes válasszal nyílik meg.

Kezdés az 1. szintnél →
Veszteségtáj felülről, szintvonalakkal. Az arany vonal egy tanuló algoritmus útja: minden lépésben lefelé indul, amíg el nem ér a völgy aljára.

Mielőtt elindulsz

A fenti kép egy veszteségtáj, mint egy turistatérkép szintvonalai. Ez az anyag azt magyarázza el, mi ez a „magasság”, ki határozza meg, és miért ezen múlik minden, amit egy modell megtanul.

A három mélységi réteg közül bármikor válthatsz. Az egyszerű réteg képlet nélkül, példákkal magyaráz. A matematika bevezeti a jelöléseket, és minden jelet megmagyaráz, amikor először előkerül. A kutatói szint a szakirodalomhoz köt. A kvízek az egyszerű és a matematikai rétegre épülnek. A kódrészletek olvasásra valók, soronként kommentálva.

  1. 1Egy szám a tévedésre
  2. 2Sok hibából egy szám
  3. 3A veszteségtáj
  4. 4Lejtőn lefelé
  5. 5Osztályozás és keresztentrópia
  6. 6Honnan jönnek a veszteségek?
  7. 7A mérce testre szabása
  8. 8Amikor a mérce elcsúszik
0 / 8

Minden teljesített szint egy réteg. A haladásod csak ebben a böngészőben tárolódik.

1. szint a 8-ból · kb. 25 perc · három mélységben · szintzáró kvíz

Egy szám, ami megmondja, mennyit tévedtünk

Cél:megérteni, mi a veszteség, miért kell egyetlen számnak lennie, és hogy a mércét mi választjuk.

Egy modell megbecsüli egy lakás árát: 51,5 millió forint. A lakás végül 50 millióért kelt el. Mennyire jó ez a becslés?

Egy embernek elég annyi, hogy „kicsit sokat mondott”. Egy tanuló modellnek viszont egyetlen számra van szüksége, amely annál nagyobb, minél rosszabb a becslés. Csak így tudja eldönteni, hogy egy változtatás javított-e vagy rontott. Ez a szám a veszteség. A szabályt, amellyel az eltérésből kiszámoljuk, veszteségfüggvénynek hívjuk.

Miért nem jó maga az eltérés?

Az eltérés itt +1,5 millió forint. Ha a modell a következő lakásnál 1,5 millióval alábecsül, a két eltérés átlaga 0, mintha mindkét becslés pontos lett volna. Az előjeles eltérés tehát nem mérce, mert a túl- és az alábecslések kioltják egymást. Két szokásos megoldás van: vesszük az eltérés abszolút értékét (az előjelet eldobjuk), vagy a négyzetét (a négyzet sosem negatív).

Van egy harmadik, a hétköznapokban megszokott mérce is: a „talált vagy nem talált”. Mondjuk azt, hogy ±2 millión belül a becslés talált (veszteség 0), azon kívül tévedett (veszteség egy fix érték). Ez a mérce nem tesz különbséget az 50,1 és az 51,9 milliós becslés között, pedig az egyik szinte hibátlan, a másik a sáv szélén jár. A négyzetes mérce szerint már a kis eltérés is veszteség, csak kicsi, és az eltérés négyzetével nő.

Kísérlet: egy becslés, három mérce

A lakás valódi ára 50 millió forint. Húzd a csúszkát, és nézd, mekkora veszteséget ad a három mérce. Az eltérést sávegységben mérjük: 1 egység = 2 millió forint, vagyis a ±1 a „talált” sáv széle.

4654
abszolút: |e|négyzetes: e²talált vagy nem (bent 0, kint 1,5)

Figyeld meg, hol keresztezi egymást a kék és az arany görbe: pontosan a sáv szélén, ±1-nél. A sávon belül a négyzetes veszteség kisebb, mint az abszolút, kívül sokkal nagyobb. A négyzetes mérce tehát elnézi az apró hibákat, a nagyokat viszont keményen bünteti.

Kulcsgondolat. A veszteségfüggvény nem a modell része, hanem a mérce, amit mi választunk hozzá. Ugyanaz a modell más mércével mást tanul meg. Az egész anyag erről a mondatról szól.

2. szint a 8-ból · kb. 30 perc · három mélységben · szintzáró kvíz

Sok hibából egy szám: MSE és MAE

Cél:látni, hogy a veszteség megválasztása eldönti, melyik válasz lesz „a legjobb”, és hogy az átlag, illetve a medián honnan jön.

Egy lakás helyett most hét hasonló lakás eladási árát ismered ugyanabból az utcából: 52, 48, 51, 53, 49, 50 és 52 millió forint. A kérdés: ha egyetlen számmal kellene megmondanod, mennyit ér egy lakás ebben az utcában, melyik szám lenne a legjobb? Ez a legegyszerűbb „modell”: egyetlen becslés, jelöljük c-vel.

Minden lakásra kiszámolod a veszteséget, aztán átlagolod. Ha a négyzetes veszteséget átlagolod, az az MSE (átlagos négyzetes hiba). Ha az abszolútat, az az MAE (átlagos abszolút hiba). A legjobb c az, amelyiknél ez az átlag a legkisebb.

Kísérlet: melyik szám írja le legjobban az árakat?

Mozgasd a becslést, és figyeld, hol van a két görbe alja. Aztán kapcsold be a kiugró értéket: a hetedik lakás ára 90 millióként szerepel. Lehet, hogy valaki elírta, és lehet, hogy tényleg egy luxus tetőtéri lakás került a listára.

4595

MSE(c), (millió Ft)²: a görbe alja az átlagnál van

MAE(c), millió Ft: a görbe alja a mediánnál van

a becslés (c)átlagmedián

Amit látnod kell: az MSE-görbe alja pontosan az átlagnál van, az MAE-görbéé a mediánnál (a sorba rendezett értékek középsőjénél). Kiugró érték nélkül a kettő szinte egybeesik: 50,7 és 51 millió. Ha bekapcsolod a 90 milliós árat, az átlag 56,1 millióra ugrik, a medián marad 51.

Melyik a jó? Ez nem matematikai, hanem szakmai kérdés. Ha a kiugró érték valódi (tényleg eladtak ott egy lakást 90 millióért, és a becslésnek az ilyenekre is fel kell készülnie), az MSE helyesen figyelmeztet rá. Ha elírás, az MAE-nek van igaza, mert nem hagyja magát elhúzni.

Kulcsgondolat. Nincs „semleges” veszteség. Az MSE-vel azt mondod, hogy a nagy hibák aránytalanul fontosak, az MAE-vel azt, hogy minden millió ugyanannyit ér. A két mérce más választ tart a legjobbnak.

3. szint a 8-ból · kb. 30 perc · három mélységben · szintzáró kvíz

A veszteségtáj: a paraméterek térképe

Cél:megérteni, hogy a tanulás egy táj legmélyebb pontjának keresése, és hogy ezt a tájat az adatok, a modell és a veszteség együtt adják.

Eddig egyetlen számot becsültünk. Most legyen egy igazi modell. Nyolc különböző méretű lakás eladási árát ismerjük, és a modell az alapterületből jósolja az árat: ár = w · alapterület. A w a négyzetméterár, a modell egyetlen paramétere, ezt kell megtanulni az adatokból.

Hogy kerek számokkal számolhassunk, az alapterületet tíz négyzetméterben mérjük: a 2 jelentése 20 m², a 16 jelentése 160 m². Ez nem csak kényelem: a 4. szinten kiderül, hogy a mértékegység még azt is befolyásolja, mekkorát szabad lépni tanulás közben.

Minden lehetséges w-hez tartozik egy egyenes, és minden egyeneshez egy MSE. Ha minden w-re kiszámolod az MSE-t, és felrajzolod, kapsz egy görbét. Ez a veszteségtáj. A tanulás nem más, mint ennek a tájnak a legmélyebb pontját megkeresni.

Kísérlet: egy paraméter, egy táj

Bal oldalon a nyolc lakás és a modell egyenese, pirossal a hibák. Jobb oldalon ugyanez a helyzet a veszteségtájon, egyetlen pontként.

012

Adat és modell: alapterület (10 m²) – ár (millió Ft)

Veszteségtáj: MSE a w függvényében

Két paraméternél (például ha a modell ár = w · alapterület + b, vagyis egy alapárat is tanul, amely nem függ a mérettől) a táj már felület, mint a lap tetején lévő szintvonalas térkép. Egy neurális hálónak milliónyi vagy milliárdnyi paramétere van, így a tája ennyi dimenziós. Ezt senki nem látja. Az algoritmus sem látja: csak azt érzékeli, merre lejt a talaj ott, ahol éppen áll. Erről szól a 4. szint.

Kulcsgondolat. A veszteségtáj alakját az adatok, a modell (milyen függvényeket tud felvenni) és a választott veszteségfüggvény (mit tartunk rossznak) együtt határozzák meg; az optimalizáló pedig azt szabályozza, hogyan haladunk ezen a tájon. Ha az adatokat, a modellt vagy a veszteségfüggvényt módosítod, megváltozhat a veszteségtáj és a minimum helye is.

4. szint a 8-ból · kb. 35 perc · három mélységben · szintzáró kvíz

Lejtőn lefelé: a gradiens-módszer

Cél:megérteni, hogyan találja meg az algoritmus a völgy alját, amikor nem látja a tájat, és miért kritikus a lépésköz.

Képzeld el, hogy sűrű ködben állsz egy domboldalon, és le kell jutnod a völgybe. A völgyet nem látod, de a talpadon érzed, merre lejt a talaj. A legjobb stratégia: lépj egyet a lejtés irányába, aztán újra tapogasd ki, merre lejt, és lépj megint. Ez a gradiens-módszer. A gradiens azt mutatja meg, merre nőne leggyorsabban a veszteség, és milyen meredeken; a módszer ezért az ellenkező irányba, lefelé lép.

Egyetlen fontos döntés marad: mekkorát lépj. Ez a tanulási ráta. Ha túl kicsit, évekig tart leérni. Ha túl nagyot, átlépsz a völgy felett a túloldalra, és ha nagyon nagyot, minden lépéssel egyre magasabbra jutsz: az algoritmus „szétszáll”.

Kísérlet: találd meg a jó lépésközt

Ugyanaz a táj, mint a 3. szinten: a négyzetméterár keresése. Állítsd be a tanulási rátát, és lépkedj. Próbáld ki a 0,003-at, a 0,009-et és a 0,011-et.

0,00050,012

A lépések a veszteségtájon

Egy neurális hálóban ugyanez történik, csak nem egy, hanem millió paraméterrel egyszerre. Minden paraméterre kiszámolják, mennyire változna a veszteség, ha azt a paramétert kicsit megmozdítanánk (ez a gradiens), és mindegyiket egy kicsit abba az irányba mozdítják, amerre a veszteség csökken. A gradienst hatékonyan a visszaterjesztés (backpropagation) számolja ki; a paramétereket pedig az optimalizáló módosítja.

Kulcsgondolat. A tanuló algoritmus csak a veszteség meredekségét érzékeli. Ezért olyan veszteség kell, amely használható irányjelzést ad a paraméterek módosításához. Néhány nem deriválható pont (mint az abszolút érték vagy a ReLU törése) kezelhető; a „talált vagy nem” mércén viszont nem lehet közvetlenül tanítani, mert szinte mindenhol vízszintes, és nem mutat irányt.

5. szint a 8-ból · kb. 35 perc · három mélységben · szintzáró kvíz

Osztályozás: valószínűség és keresztentrópia

Cél:megérteni, milyen veszteséggel tanul egy osztályozó, és miért a magabiztos tévedés a legdrágább.

Eddig számot jósoltunk (lakásárat). Sok feladatban viszont kategóriát kell választani. Egy levélszűrőnek egy beérkező e-mail alapján azt kell eldöntenie, hogy a levél rendes levél, reklám vagy adathalász (csaló) levél. Itt nincs értelme „0,3 millió forintot tévedni”. Ehelyett a modell valószínűségeket ad: például 20% rendes, 70% reklám, 10% adathalász.

A modell belül először nyers pontszámokat számol, egyet minden osztályra. Ezek a logitok, és bármilyen valós számok lehetnek. A softmax nevű lépés alakítja őket valószínűségekké: mindegyik 0 és 1 közé kerül, és az összegük 1 lesz. A nagyobb pontszám nagyobb valószínűséget kap.

A veszteség: mennyire lepődik meg a modell

Ha a levél valójában reklám, a veszteség csak attól függ, mekkora valószínűséget adott a modell a reklámra. A keresztentrópia ezt így számolja: a helyes osztály valószínűségének negatív logaritmusa. A képlet mögötti érzés egyszerű:

A helyes osztály valószínűségeVeszteségÉrtelmezés
0,990,01biztos és igaza van: szinte nincs mit tanulni
0,50,69bizonytalan volt
0,12,30rossz felé hajlott
0,014,61magabiztosan tévedett: nagyon drága

Kísérlet: levélszűrő

Állítsd a három logitot, válaszd ki, melyik a valódi osztály, és figyeld a veszteséget. Próbáld ki, mi történik, ha a modell nagyon biztos a rossz válaszban.

Valódi osztály:

A veszteség (−ln p) a helyes osztály valószínűségének függvényében. Balra, a nullánál a görbe az égbe szökik.

Miért nem a találati arányon tanítunk?

A találati arány (hány százalékot talált el) a számunkra fontos mérce, de ugyanaz a baj vele, mint a „talált vagy nem” veszteséggel. Egy kis változtatás a súlyokon általában egyetlen döntést sem fordít meg, így a meredeksége szinte mindenhol nulla. A keresztentrópia viszont a valószínűség minden apró változására reagál, így mindig van iránya. A találati arányt a tanítás után mérjük, a keresztentrópián tanítunk.

Kulcsgondolat. A keresztentrópia nem csak azt bünteti, ha a modell téved, hanem azt is, mennyire volt biztos a tévedésében. Ez jó tanulási cél valószínűségi előrejelzéshez: a modellt a jól kalibrált valószínűségek felé tereli. Garanciát viszont nem ad: véges adaton, adott modellel és tanítással a modern neurális hálók gyakran túl magabiztosak, ezért a kalibrációt külön mérni kell [43].

6. szint a 8-ból · kb. 30 perc · három mélységben · szintzáró kvíz

Honnan jönnek a veszteségek?

Cél:látni, hogy a veszteségek nem ötletszerűek, hanem mindegyik mögött egy feltevés áll arról, hogyan zajos a világ.

Eddig úgy tűnhetett, hogy az MSE, az MAE és a keresztentrópia három külön ötlet. Valójában egyetlen elvből következnek. Az elv neve maximum likelihood: válaszd azt a modellt, amelyik mellett a ténylegesen megfigyelt adat a legvalószínűbb.

Ehhez el kell döntened, hogyan képzeled a zajt. Ha úgy gondolod, hogy a hibák többnyire kicsik, a nagy hibák pedig nagyon ritkák (a jól ismert haranggörbe, a Gauss-eloszlás), abból az MSE következik (megfordítva nem igaz: az MSE-hez nem kötelező Gauss-zajt feltenni). Ha úgy gondolod, hogy a nagy kiugrások gyakoribbak ennél (csúcsosabb eloszlás vastagabb szélekkel, a Laplace-eloszlás), abból az MAE. A kategóriák valószínűségeiből pedig a keresztentrópia.

Kísérlet: zajfeltevésből veszteség

Bal oldalon a két zajeloszlás, jobb oldalon a negatív logaritmusuk. Figyeld meg: a Gauss-ból parabola lesz (négyzetes veszteség), a Laplace-ból V alak (abszolút veszteség).

0,52

Zajeloszlás: mennyire valószínű egy e hiba

−ln(valószínűség): ez lesz a veszteség

Gauss → négyzetes veszteségLaplace → abszolút veszteség

Ez a felismerés megfordítja a kérdést. Ha tudod, milyen az adataid zaja, abból levezetheted a hozzá illő veszteséget. Egy jó digitális hőmérő leolvasási hibája közel Gauss-eloszlású. Egy kézzel vezetett időjárás-napló, amelybe néha elütnek egy számjegyet, már nem: ritkán, de akkor nagyot téved. A 2. szinten ösztönösen érzett kérdésre („a 90 milliós ár valódi-e”) itt kapsz elvi választ: a veszteség választása egy feltevés a világról.

Kulcsgondolat. Sok veszteség mögött egy kimondatlan feltevés áll arról, milyen hibákat tart a modell gyakorinak és ritkának. Az MSE egyik valószínűségi indoklása a haranggörbe alakú (Gauss-) zaj. MSE-t azonban akkor is választhatsz, ha egyszerűen a nagy eltéréseket akarod erősebben büntetni; ehhez nem kell normális eloszlást feltételezni. A veszteség a döntés költségeiből is levezethető (erről a 7. szint szól).

7. szint a 8-ból · kb. 35 perc · három mélységben · szintzáró kvíz

A mérce testre szabása

Cél:megtanulni a veszteséget a valódi költségekhez igazítani, és felismerni, mikor tanul a modell túl jól.

Aszimmetrikus költség

Egy pékségben minden hajnalban el kell dönteni, hány kenyeret süssenek. A kereslet napról napra ingadozik. Ha kevés a kenyér, a délután érkező vevő üres polcot talál: elmarad az eladás, és lehet, hogy legközelebb máshová megy. Ha sok, a maradékot este ki kell dobni. A kettő nem egyformán drága, de az MSE és az MAE ezt nem tudja, mert szimmetrikusak: nekik tíz kenyérrel több és tíz kenyérrel kevesebb ugyanannyit ér.

A megoldás egy aszimmetrikus veszteség: a hiányt k-szor drágábbnak számoljuk, mint a maradékot. Ezt kvantilis vagy pinball-veszteségnek hívják. A matematika egy nagyon gyakorlatias szabályt ad: az optimális mennyiségnél a napok 1/(k+1) részében fogy el minden kenyér. Ha a hiány kilencszer drágább, a napok 10%-ában fogyjon el, és ebből kiszámolható, hány kenyérrel kell többet sütni az átlagos keresletnél.

Kísérlet: hány kenyeret süss?

A kereslet ingadozása adott. Állítsd be, hányszor drágább a hiány, mint a maradék, és nézd meg, hová kerül az optimális mennyiség.

Várható napi veszteség a többlet függvényében (egység: egy megmaradt kenyér ára)

Maradék (+) és hiány (−) eloszlása az optimális mennyiségnél; pirossal a hiányos napok

Túl jó tanulás: a túlillesztés

Egy elég rugalmas modell nagyon kis hibát érhet el a tanítóadatokon. Ez önmagában még nem bizonyít túlillesztést: nagyon túlparaméterezett modellek nulla tanítási hiba mellett is általánosíthatnak jól [25]. Túlillesztésre az utal, ha a tanítási veszteség tovább csökken, miközben a félretett, megfelelően választott adatokon mért teljesítmény romlik. Zajos adatoknál (a 2. szint irreducibilis hibája) ennek egyik oka lehet, hogy a modell a tanítóminta véletlen sajátosságaihoz is alkalmazkodik. Olyan ez, mint a diák, aki a tavalyi feladatsor megoldásait tanulta meg, nem a módszert.

Ezért az adatok egy részét félretesszük, és csak ellenőrzésre használjuk: ez a validációs halmaz. A tanítás közben mindkét veszteséget figyeljük.

Tanítási és validációs veszteség

Sematikus ábra. A tanítási veszteség folyamatosan csökken, a validációs egy ponton megfordul: ott érdemes megállni.

tanítási veszteségvalidációs veszteségkorai leállítás

Büntetőtagok: regularizáció

A túlillesztés ellen a veszteséghez egy második tagot adhatunk, amely a túl bonyolult modellt bünteti, például a nagy súlyokat. A modell így két dolog között egyensúlyoz: illeszkedjen az adatokhoz, de maradjon egyszerű. Ugyanígy a veszteségbe tudás is beépíthető. A fizikával informált neurális hálóknál (PINN) egy tag azt bünteti, ha a modell megsérti a fizikai egyenletet, például a hővezetés egyenletét, még ott is, ahol nincs mérés.

Kulcsgondolat. A veszteségfüggvénybe mindent beleírhatsz, ami számodra fontos: a valódi költségarányokat, az egyszerűség iránti igényt, a fizikai törvényeket. A modell mindezt figyelembe veszi, de csak azt, ami benne van.

8. szint a 8-ból · kb. 35 perc · három mélységben · szintzáró kvíz

Amikor a mérce elcsúszik a céltól

Cél:megérteni, miért veszélyes egy mércét túl erősen optimalizálni, és hogyan kezelik ezt a mai nyelvi modelleknél.

Minden veszteségfüggvény helyettesítő: egy mérhető szám, amely remélhetőleg együtt mozog azzal, amit igazán akarunk. Amíg gyengén optimalizálunk, a kettő együtt javul. Ha viszont nagyon erősen nyomjuk a mércét, a rendszer megtalálja azokat a réseket, ahol a mérce javítható a valódi cél nélkül, vagy annak rovására.

Ezt a jelenséget egy közgazdászról, Goodhartról nevezték el. A ma ismert megfogalmazás Strathern antropológustól származik: ha egy mérőszámból cél lesz, megszűnik jó mérőszám lenni [28]. A hétköznapokból is ismerős: ha egy ügyfélszolgálatot csak a hívások hosszával mérnek, a hívások rövidülnek, a problémák viszont nem feltétlenül oldódnak meg.

Kísérlet: a helyettesítő mérce és a valódi cél

Sematikus modell. Növeld az optimalizálás erejét, és figyeld, meddig mozog együtt a két görbe.

010

helyettesítő mérce (amit optimalizálunk)valódi cél (amit akarunk)

A gépek is játszmáznak

A gépi tanulásban ezt specifikációs játszmázásnak vagy jutalom-hackelésnek (reward hacking) hívják. Klasszikus példa egy hajóversenyes játék, amelyben a pontszámot maximalizáló ágens nem ért célba: rájött, hogy többet kap, ha egy kis lagúnában körbe-körbe fut, és újra meg újra felveszi ugyanazokat a bónuszokat [32]. Az ágens nem hibázott: pontosan azt tette, amit a mérce jutalmazott [33].

A nagy nyelvi modellek esete

Egy nyelvi modell finomhangolásánál a „jó válasz” mércéjét nem lehet képletbe írni. Ezért megtanulják: emberek sok válaszpárt összehasonlítanak, és ezekből egy külön modell, a jutalommodell, megtanulja megjósolni, melyik válasz tetszene jobban. Ezután a nyelvi modellt úgy tanítják, hogy ezt a jutalmat maximalizálja. Ez az RLHF, a megerősítéses tanulás emberi visszajelzésből [34].

A jutalommodell viszont maga is helyettesítő, és ha túl erősen optimalizálnak rá, a nyelvi modell megtanulja kihasználni a gyengeségeit. Ezért kap egy fékezőt: egy büntetést azért, ha túl messzire távolodik az eredeti modelltől. Ez a büntetés a 6. szinten megismert KL-divergencia.

Kulcsgondolat. Képletesen: a veszteségfüggvény az, amit a tanítás során a rendszer „akar” (ez metafora, nem a kész modell szándéka). Ha a mérce és a valódi cél eltér, egy elég erős optimalizáló megtalálhatja a különbséget, és kihasználhatja; ez kockázat, nem minden célfüggvénynél szükségszerű. Ezért egy rendszer tervezésekor a legnehezebb kérdés sokszor nem az, hogyan optimalizáljunk, hanem az, hogy mit.

Kitekintés: kapcsolódó elméletek és spekulatív modellek

Választható kitekintés. Az alábbi elméletek vitatottak, részben spekulatívak. Nem a veszteségfüggvényről tanult mérnöki állítások bizonyítékai, csak rokon gondolatok.

A veszteségfüggvény gondolata messze túlnyúlik a gépi tanuláson. Friston szabadenergia-elve szerint az agy is egy mennyiséget minimalizál: a predikciós hibájához kötődő variációs szabadenergiát [36]. Vanchurin spekulatív modelljében pedig a fizikai világ egy tanuló hálózatként írható le, amelyben a veszteség szerepét egy termodinamikai mennyiség tölti be [37]. Mindkettő ugyanazt a kérdést veti fel, amelyből ez az anyag kiindult: mit minimalizál a rendszer, és ki vagy mi határozta meg ezt?

Összefoglaló táblázat

Melyik veszteség mögött milyen feltevés áll, és mikor érdemes választani.

VeszteségFeladatValószínűségi indoklás, illetve feltevésMikor válaszd
MSE (négyzetes)szám jóslásaGauss-zaja nagy hibák valódiak és drágák
MAE (abszolút)szám jóslásaLaplace-zajkiugró adathibák várhatók
Huberszám jóslásatöbbnyire Gauss, néha kiugrásrobusztusság kell, de sima gradiens is
Pinball (kvantilis)szám jóslásaaszimmetrikus költséga hiány és a többlet ára eltér
Keresztentrópiaosztályozás, nyelvi modellkategorikus eloszlásvalószínűséget kell jósolni
Fókusz / súlyozott CEritka osztályokkiegyensúlyozatlan adatoka ritka hiba a fontos
+ L2 büntetésbármelyik mellékis súlyok (Gauss-prior)túlillesztés ellen
+ fizikai reziduumPINNismert egyenletkevés adat, ismert fizika
Jutalom − β·KLRLHFtanult emberi preferenciaa „jó” nem írható képletbe

Glosszárium

Veszteségfüggvényloss function
Szabály, amely egy jóslatból és a helyes értékből egy számot képez: annál nagyobbat, minél rosszabb a jóslat.
Célfüggvény, költségfüggvényobjective, cost
Amit ténylegesen optimalizálunk: a veszteségek átlaga, esetleg büntetőtagokkal kiegészítve.
Reziduumresidual
A jóslat és a valódi érték különbsége, ŷ − y.
MSE, RMSEmean squared error
Az eltérések négyzetének átlaga, illetve annak gyöke. Az átlagnál minimális.
MAEmean absolute error
Az eltérések abszolút értékének átlaga. A mediánnál minimális, kiugró értékekre kevésbé érzékeny.
Huber-veszteség
Kis hibánál négyzetes, nagynál lineáris veszteség. Robusztus, és a gradiense mindenhol értelmes.
Irreducibilis hiba
A veszteségnek az a része, amelyet a zaj okoz, és semmilyen modell nem tud eltüntetni.
Veszteségtájloss landscape
A veszteség értéke a modell paramétereinek függvényében. A tanulás ennek legmélyebb pontját keresi.
Konvex
Olyan tál alakú függvény, amelynek minden lokális minimuma globális.
Nyeregpont
Olyan pont, ahol a lejtő nulla, de egyes irányokban lefelé, másokban felfelé görbül a táj.
Gradiens
A veszteség meredekségeinek vektora az egyes paraméterek szerint. A legmeredekebb emelkedés irányába mutat.
Gradiens-módszergradient descent
Iteratív eljárás: minden lépésben a gradienssel ellentétes irányba mozdítja a paramétereket.
Tanulási rátalearning rate, η
A lépésköz a gradiens-módszerben. Túl kicsi: lassú. Túl nagy: oszcillál vagy szétszáll.
SGD, minibatch
Sztochasztikus gradiens-módszer: minden lépésben csak az adatok egy kis véletlen részhalmazán számolt gradienst használ.
Visszaterjesztésbackpropagation
A gradiens hatékony kiszámítása a láncszabállyal, a kimenettől a bemenet felé haladva.
Logit
Osztályonkénti nyers pontszám a softmax előtt. Tetszőleges valós szám lehet.
Softmax
Függvény, amely a logitokból 0 és 1 közötti, összesen 1-et adó valószínűségeket képez.
Keresztentrópiacross-entropy
A helyes osztály valószínűségének negatív logaritmusa, átlagolva. Az osztályozók és a nyelvi modellek alapvesztesége.
Perplexitás
A keresztentrópia exponenciálisa. Nyelvi modelleknél elterjedt mérőszám.
Likelihood, maximum likelihood
Annak valószínűsége, hogy adott modell mellett a látott adatot kapjuk. A maximum likelihood ezt maximalizáló paramétert választ.
Negatív log-likelihoodNLL
A likelihood negatív logaritmusa. A legtöbb veszteségfüggvény ilyen alakú.
KL-divergencia
Két valószínűségeloszlás eltérésének mértéke. Nem szimmetrikus.
Fisher-információ
Regularitási feltételek mellett a negatív log-likelihood várható görbülete (a Hesse-mátrix várható értéke a modell eloszlása szerint). Azt méri, mennyi információt hordoz az adat a paraméterekről.
Pinball- vagy kvantilis veszteség
Aszimmetrikus lineáris veszteség. Minimuma egy kvantilisnél van, nem az átlagnál.
Túlillesztésoverfitting
A modell a tanítóadat zaját is megtanulja, és új adaton rosszabbul teljesít.
Validációs halmaz
Tanításra nem használt adatok, amelyeken a modell általánosító képességét mérjük.
Regularizáció
A célfüggvényhez adott büntetőtag, amely az egyszerűbb modellt részesíti előnyben.
Goodhart-törvény
Ha egy mérőszámból cél lesz, megszűnik jó mérőszám lenni.
Jutalom-hackelés, specifikációs játszmázás
A rendszer a mércét javítja a valódi cél helyett vagy annak rovására.
Jutalommodellreward model
Emberi preferenciákból tanított modell, amely a „jó válasz” mércéjét adja az RLHF-ben.

Irodalom

  1. [1]

    Taguchi, G. (1986). Introduction to Quality Engineering: Designing Quality into Products and Processes. Asian Productivity Organization. 1. szint

  2. [2]

    Wald, A. (1950). Statistical Decision Functions. Wiley. 1. szint

  3. [3]

    Legendre, A.-M. (1805). Nouvelles méthodes pour la détermination des orbites des comètes. Paris: Firmin Didot. 2. szint

  4. [4]

    Gauss, C. F. (1809). Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Hamburg: Perthes & Besser. 2. szint

  5. [5]

    Huber, P. J. (1964). Robust Estimation of a Location Parameter. The Annals of Mathematical Statistics, 35(1), 73–101. 2. szint

  6. [6]

    Goodfellow, I., Bengio, Y., Courville, A. (2016). Deep Learning. MIT Press. deeplearningbook.org · 1–3. szint

  7. [7]

    Dauphin, Y. N. et al. (2014). Identifying and attacking the saddle point problem in high-dimensional non-convex optimization. NeurIPS. arXiv:1406.2572 · 3. szint

  8. [8]

    Li, H., Xu, Z., Taylor, G., Studer, C., Goldstein, T. (2018). Visualizing the Loss Landscape of Neural Nets. NeurIPS. arXiv:1712.09913 · 3. szint

  9. [9]

    Keskar, N. S. et al. (2017). On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima. ICLR. arXiv:1609.04836 · 3. szint

  10. [10]

    Robbins, H., Monro, S. (1951). A Stochastic Approximation Method. The Annals of Mathematical Statistics, 22(3), 400–407. 4. szint

  11. [11]

    Rumelhart, D. E., Hinton, G. E., Williams, R. J. (1986). Learning representations by back-propagating errors. Nature, 323, 533–536. 4. szint

  12. [12]

    Kingma, D. P., Ba, J. (2015). Adam: A Method for Stochastic Optimization. ICLR. arXiv:1412.6980 · 4. szint

  13. [13]

    Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27, 379–423, 623–656. 5. szint

  14. [14]

    Szegedy, C. et al. (2016). Rethinking the Inception Architecture for Computer Vision. CVPR. arXiv:1512.00567 · 5. szint

  15. [15]

    Müller, R., Kornblith, S., Hinton, G. (2019). When Does Label Smoothing Help? NeurIPS. arXiv:1906.02629 · 5. szint

  16. [16]

    Lin, T.-Y., Goyal, P., Girshick, R., He, K., Dollár, P. (2017). Focal Loss for Dense Object Detection. ICCV. arXiv:1708.02002 · 5. szint

  17. [17]

    Fisher, R. A. (1922). On the Mathematical Foundations of Theoretical Statistics. Philosophical Transactions of the Royal Society A, 222, 309–368. 6. szint

  18. [18]

    Kullback, S., Leibler, R. A. (1951). On Information and Sufficiency. The Annals of Mathematical Statistics, 22(1), 79–86. 6. szint

  19. [19]

    Hinton, G., Vinyals, O., Dean, J. (2015). Distilling the Knowledge in a Neural Network. arXiv:1503.02531 · 6. szint

  20. [20]

    Kendall, A., Gal, Y. (2017). What Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision? NeurIPS. arXiv:1703.04977 · 6. szint

  21. [21]

    Amari, S. (1998). Natural Gradient Works Efficiently in Learning. Neural Computation, 10(2), 251–276. 6. szint

  22. [22]

    Koenker, R., Bassett, G. (1978). Regression Quantiles. Econometrica, 46(1), 33–50. 7. szint

  23. [23]

    Krogh, A., Hertz, J. A. (1992). A Simple Weight Decay Can Improve Generalization. NeurIPS 4. 7. szint

  24. [24]

    Loshchilov, I., Hutter, F. (2019). Decoupled Weight Decay Regularization. ICLR. arXiv:1711.05101 · 7. szint

  25. [25]

    Belkin, M., Hsu, D., Ma, S., Mandal, S. (2019). Reconciling modern machine-learning practice and the classical bias–variance trade-off. PNAS, 116(32), 15849–15854. 7. szint

  26. [26]

    Raissi, M., Perdikaris, P., Karniadakis, G. E. (2019). Physics-informed neural networks: A deep learning framework for solving forward and inverse problems involving nonlinear partial differential equations. Journal of Computational Physics, 378, 686–707. 7. szint

  27. [27]

    Wang, S., Teng, Y., Perdikaris, P. (2021). Understanding and mitigating gradient flow pathologies in physics-informed neural networks. SIAM Journal on Scientific Computing, 43(5), A3055–A3081. 7. szint

  28. [28]

    Strathern, M. (1997). ‘Improving ratings’: audit in the British University system. European Review, 5(3), 305–321. 8. szint

  29. [29]

    Goodhart, C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. In Papers in Monetary Economics, Vol. I. Reserve Bank of Australia. 8. szint

  30. [30]

    Manheim, D., Garrabrant, S. (2018). Categorizing Variants of Goodhart's Law. arXiv:1803.04585 · 8. szint

  31. [31]

    Amodei, D. et al. (2016). Concrete Problems in AI Safety. arXiv:1606.06565 · 8. szint

  32. [32]

    Clark, J., Amodei, D. (2016). Faulty Reward Functions in the Wild. OpenAI blog. 8. szint

  33. [33]

    Krakovna, V. et al. (2020). Specification gaming: the flip side of AI ingenuity. DeepMind blog. 8. szint

  34. [34]

    Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback. NeurIPS. arXiv:2203.02155 · 8. szint

  35. [35]

    Gao, L., Schulman, J., Hilton, J. (2023). Scaling Laws for Reward Model Overoptimization. ICML. arXiv:2210.10760 · 8. szint

  36. [36]

    Friston, K. (2010). The free-energy principle: a unified brain theory? Nature Reviews Neuroscience, 11, 127–138. 8. szint

  37. [37]

    Vanchurin, V. (2020). The World as a Neural Network. Entropy, 22(11), 1210. 8. szint

  38. [38]

    Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 · 5. szint

  39. [39]

    Dinh, L., Pascanu, R., Bengio, S., Bengio, Y. (2017). Sharp Minima Can Generalize For Deep Nets. ICML. arXiv:1703.04933 · 3. szint

  40. [40]

    Martens, J. (2020). New Insights and Perspectives on the Natural Gradient Method. Journal of Machine Learning Research, 21. arXiv:1412.1193 · 6. szint

  41. [41]

    Kunstner, F., Balles, L., Hennig, P. (2019). Limitations of the Empirical Fisher Approximation for Natural Gradient Descent. NeurIPS. arXiv:1905.12558 · 6. szint

  42. [42]

    Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer, 10.1. fejezet. 6. szint

  43. [43]

    Guo, C., Pleiss, G., Sun, Y., Weinberger, K. Q. (2017). On Calibration of Modern Neural Networks. ICML. arXiv:1706.04599 · 5. szint

A demók szemléltető, kitalált adatokkal dolgoznak.