Մեր մասին    Կապ     

Խոսքի ճանաչում | Ձայնի սինթեզ | Մեքեն. թարգմ | Հայկական AI | RAG | Տեսադարան

Թարգմանչաց շարժման տեսադարանը



Լեզուների խոշոր մոդելները համառոտ բացատրված են.mp4


WEBVTT

00:00.000 --> 00:07.000
Պատկերացրեք, որ դուք պատահում եք մի կարճ ֆիլմի սցենարի, որը նկարագրում է մի տեսարան մարդու և նրա AI օգնականի միջև:

00:07.000 --> 00:13.000
Սցենարն ունի այն, ինչ մարդը հարցնում է AI-ին, բայց AI-ի պատասխանը կտրված է:

00:13.000 --> 00:20.000
Ենթադրենք, դուք ևս ունեք այս հզոր կախարդական մեքենան, որը կարող է վերցնել ցանկացած տեքստ և խելամիտ կանխատեսում տալ, թե հաջորդ բառն ինչ է լինելու:

00:21.000 --> 00:32.000
Այնուհետև դուք կարող եք ավարտել սցենարը՝ սնելով մեքենային ձեր ունեցածը, տեսնելով, թե ինչ կկանխատեսի այն, որպեսզի սկսի AI-ի պատասխանը, և այնուհետև կրկնելով դա անընդհատ աճող սցենարով՝ ավարտին հասցնելով երկխոսությունը:

00:33.000 --> 00:36.000
Երբ դուք շփվում եք չաթբոտի հետ, դա հենց այն է, ինչ տեղի է ունենում:

00:36.000 --> 00:44.000
Լեզվի մեծ մոդելը բարդ մաթեմատիկական ֆունկցիա է, որը կանխատեսում է, թե որ բառը հաջորդում է ցանկացած տեքստի:

00:44.000 --> 00:51.000
Այնուամենայնիվ, մեկ բառը որոշակիորեն կանխատեսելու փոխարեն, այն ինչ անում է, հավանականություն է վերագրում բոլոր հնարավոր հաջորդ բառերին:

00:51.000 --> 00:58.000
Չաթ-բոտ ստեղծելու համար այն, ինչ դուք անում եք, տեքստ է դնում, որը նկարագրում է օգտատիրոջ և հիպոթետիկ AI օգնականի փոխազդեցությունը:

00:59.000 --> 01:12.000
Դուք ավելացնում եք այն, ինչ օգտատերը մուտքագրում է որպես այդ փոխազդեցության առաջին մաս, և այնուհետև մոդելը բազմիցս կանխատեսում է հաջորդ բառը, որը նման հիպոթետիկ AI օգնականը կասի ի պատասխան, և դա այն է, ինչ ներկայացվում է օգտատիրոջը:

01:12.000 --> 01:19.000
Դա անելիս արդյունքը շատ ավելի բնական է թվում, եթե թույլ տաք, որ ճանապարհին պատահականորեն ընտրի ավելի քիչ հավանական բառեր:

01:19.000 --> 01:27.000
Այսպիսով, սա նշանակում է, թեև մոդելն ինքնին դետերմինիստական ​​է, տրված հուշումը սովորաբար տարբեր պատասխան է տալիս ամեն անգամ, երբ այն գործարկվում է:

01:27.000 --> 01:34.000
Մոդելները սովորում են, թե ինչպես անել այս կանխատեսումները՝ մշակելով հսկայական քանակությամբ տեքստ, որը սովորաբար ստացվում է ինտերնետից:

01:34.000 --> 01:44.000
Որպեսզի սովորական մարդը կարդա տեքստի այն քանակությունը, որն օգտագործվել է GPT-3-ին մարզելու համար, օրինակ, եթե նրանք անդադար կարդան 24-7, դա կպահանջի ավելի քան 2600 տարի:

01:44.000 --> 01:47.000
Այդ ժամանակից ի վեր ավելի մեծ մոդելները մարզվում են շատ, շատ ավելին:

01:47.000 --> 01:51.000
Դուք կարող եք մտածել մարզումների մասին մի փոքր այնպես, ինչպես կարգավորել հավաքատեղերը մեծ մեքենայի վրա:

01:52.000 --> 02:00.000
Լեզվի մոդելի վարքագծի ձևը լիովին որոշվում է այս բազմաթիվ տարբեր շարունակական արժեքներով, որոնք սովորաբար կոչվում են պարամետրեր կամ կշիռներ:

02:00.000 --> 02:07.000
Այդ պարամետրերը փոխելը կփոխի հավանականությունները, որոնք մոդելը տալիս է տվյալ մուտքագրման հաջորդ բառի համար:

02:07.000 --> 02:14.000
Մեծ լեզվի մոդելը սահմանում է այն, թե ինչպես նրանք կարող են ունենալ հարյուրավոր միլիարդավոր այս պարամետրեր:

02:15.000 --> 02:18.000
Ոչ մի մարդ երբեք միտումնավոր չի սահմանում այդ պարամետրերը:

02:18.000 --> 02:26.000
Փոխարենը, դրանք սկսվում են պատահականորեն, ինչը նշանակում է, որ մոդելը պարզապես ցուցադրում է անհեթեթություն, բայց դրանք բազմիցս ճշգրտվում են՝ հիմնվելով տեքստի բազմաթիվ օրինակների վրա:

02:26.000 --> 02:42.000
Այս ուսուցման օրինակներից մեկը կարող է լինել ընդամենը մի բուռ բառեր, կամ կարող է լինել հազարավոր, բայց երկու դեպքում էլ, ինչպես դա աշխատում է, այս օրինակից բոլորը, բացի վերջին բառից, անցնում է մոդել և համեմատում դրա կանխատեսումը օրինակի իսկական վերջին բառի հետ:

02:42.000 --> 02:55.000
Backpropagation կոչվող ալգորիթմն օգտագործվում է բոլոր պարամետրերը այնպես շտկելու համար, որ մոդելը մի փոքր ավելի հավանական է դարձնում ճշմարիտ վերջին բառը և մի փոքր ավելի քիչ հավանականությունը ընտրելու բոլոր մյուսները:

02:55.000 --> 03:08.000
Երբ դուք դա անում եք շատ ու շատ տրիլիոն օրինակների համար, մոդելը ոչ միայն սկսում է ավելի ճշգրիտ կանխատեսումներ տալ ուսուցման տվյալների վերաբերյալ, այլ նաև սկսում է ավելի խելամիտ կանխատեսումներ անել տեքստի վերաբերյալ, որը նախկինում երբեք չի տեսել:

03:09.000 --> 03:19.000
Հաշվի առնելով պարամետրերի հսկայական քանակությունը և ուսուցման տվյալների հսկայական քանակը, լեզվական մեծ մոդելի ուսուցման մեջ ներգրավված հաշվարկների սանդղակը ապշեցուցիչ է:

03:19.000 --> 03:25.000
Պատկերացրեք, որ ամեն վայրկյան կարող եք մեկ միլիարդ գումարում և բազմապատկում կատարել:

03:25.000 --> 03:32.000
Ի՞նչ եք կարծում, որքա՞ն ժամանակ կպահանջվի, որպեսզի կատարեք այն բոլոր գործողությունները, որոնք կապված են լեզվական ամենամեծ մոդելների պատրաստման հետ:

03:33.000 --> 03:35.000
Ի՞նչ եք կարծում, դա մեկ տարի կպահանջի՞:

03:35.000 --> 03:38.000
Միգուցե 10 000 տարվա նման մի բան:

03:38.000 --> 03:40.000
Պատասխանն իրականում շատ ավելին է, քան դա:

03:41.000 --> 03:44.000
Դա ավելի քան 100 միլիոն տարի է:

03:45.000 --> 03:47.000
Այնուամենայնիվ, սա պատմության միայն մի մասն է:

03:47.000 --> 03:49.000
Այս ամբողջ գործընթացը կոչվում է նախավարժանք:

03:49.000 --> 03:56.000
Ինտերնետից տեքստի պատահական հատվածը ավտոմատ կերպով լրացնելու նպատակը շատ տարբեր է արհեստական ​​ինտելեկտի լավ օգնական լինելու նպատակից:

03:56.000 --> 04:04.000
Այս խնդիրը լուծելու համար չաթ-բոտերը անցնում են մեկ այլ տեսակի ուսուցում, նույնքան կարևոր, որը կոչվում է ամրապնդման ուսուցում մարդկային արձագանքով:

04:04.000 --> 04:14.000
Աշխատողները նշում են անօգուտ կամ խնդրահարույց կանխատեսումները, և դրանց ուղղումները հետագայում փոխում են մոդելի պարամետրերը, ինչը նրանց ավելի հավանական է դարձնում օգտատերերի նախընտրած կանխատեսումները:

04:15.000 --> 04:27.000
Այնուամենայնիվ, հետ նայելով նախնական պարապմունքին, հաշվարկների այս ապշեցուցիչը հնարավոր է դառնում միայն հատուկ համակարգչային չիպերի միջոցով, որոնք օպտիմիզացված են շատ ու շատ գործողություններ զուգահեռ իրականացնելու համար, որոնք հայտնի են որպես GPU:

04:27.000 --> 04:31.000
Այնուամենայնիվ, ոչ բոլոր լեզվական մոդելները կարող են հեշտությամբ զուգահեռվել:

04:31.000 --> 04:36.000
Մինչև 2017 թվականը, լեզվական մոդելների մեծ մասը մշակում էր տեքստը մեկ բառով:

04:37.000 --> 04:42.000
Բայց հետո Google-ի հետազոտողների թիմը ներկայացրեց նոր մոդել, որը հայտնի է որպես տրանսֆորմեր:

04:43.000 --> 04:49.000
Տրանսֆորմատորները չեն կարդում տեքստը սկզբից մինչև վերջ, դրանք ներծծվում են միանգամից, զուգահեռ:

04:49.000 --> 04:57.000
Առաջին քայլը տրանսֆորմատորի ներսում, և դրա համար այլ լեզվական մոդելների մեծամասնությունը, յուրաքանչյուր բառը թվերի երկար ցուցակի հետ կապելն է:

04:57.000 --> 05:10.000
Դրա պատճառն այն է, որ վերապատրաստման գործընթացը աշխատում է միայն շարունակական արժեքներով, այնպես որ դուք պետք է ինչ-որ կերպ կոդավորեք լեզուն՝ օգտագործելով թվեր, և թվերի այս ցանկից յուրաքանչյուրը կարող է ինչ-որ կերպ կոդավորել համապատասխան բառի իմաստը:

05:10.000 --> 05:16.000
Տրանսֆորմատորները յուրահատուկ են դարձնում նրանց կախվածությունը հատուկ գործողության վրա, որը հայտնի է որպես ուշադրություն:

05:16.000 --> 05:26.000
Այս գործողությունը հնարավորություն է տալիս թվերի այս բոլոր ցուցակներին խոսել միմյանց հետ և կատարելագործել այն իմաստները, որոնք նրանք կոդավորում են՝ հիմնվելով շրջակա միջավայրի վրա, և այդ ամենը կատարվում է զուգահեռ:

05:27.000 --> 05:36.000
Օրինակ, ափ բառը կոդավորող թվերը կարող են փոխվել՝ ելնելով այն շրջապատող ենթատեքստից, որպեսզի ինչ-որ կերպ կոդավորեն գետի ափի ավելի կոնկրետ հասկացությունը:

05:37.000 --> 05:48.000
Տրանսֆորմատորները սովորաբար ներառում են նաև գործողության երկրորդ տեսակը, որը հայտնի է որպես առաջընթաց նեյրոնային ցանց, և դա մոդելին տալիս է լրացուցիչ հնարավորություն՝ ուսուցման ընթացքում սովորած լեզվի մասին ավելի շատ օրինաչափություններ պահելու համար:

05:48.000 --> 06:06.000
Այս բոլոր տվյալները բազմիցս հոսում են այս երկու հիմնարար գործողությունների բազմաթիվ տարբեր կրկնությունների միջով, և երբ դա արվում է, հույս կա, որ թվերի յուրաքանչյուր ցանկը հարստացված է՝ կոդավորելու ցանկացած տեղեկատվություն, որը կարող է անհրաժեշտ լինել՝ ճշգրիտ կանխատեսում կատարելու համար, թե ինչ բառ է հաջորդում հատվածում:

06:06.000 --> 06:22.000
Վերջում մեկ վերջնական ֆունկցիա է կատարվում այս հաջորդականության վերջին վեկտորի վրա, որն այժմ հնարավորություն է ունեցել ազդելու մուտքագրված տեքստից մնացած բոլոր համատեքստից, ինչպես նաև այն ամենից, ինչ մոդելը սովորել է վերապատրաստման ընթացքում՝ հաջորդ բառի կանխատեսումը ստանալու համար:

06:22.000 --> 06:27.000
Կրկին մոդելի կանխատեսումը նման է հավանականության յուրաքանչյուր հնարավոր հաջորդ բառի համար:

06:28.000 --> 06:42.000
Թեև հետազոտողները նախագծում են այս քայլերից յուրաքանչյուրի աշխատանքի շրջանակը, կարևոր է հասկանալ, որ հատուկ վարքագիծը ի հայտ եկած երևույթ է, որը հիմնված է այն բանի վրա, թե ինչպես են կարգավորվում այդ հարյուր միլիարդավոր պարամետրերը մարզման ընթացքում:

06:42.000 --> 06:48.000
Սա աներևակայելի դժվար է դարձնում որոշել, թե ինչու է մոդելը անում ճշգրիտ կանխատեսումներ, որոնք անում է:

06:48.000 --> 06:59.000
Այն, ինչ դուք կարող եք տեսնել, այն է, որ երբ դուք օգտագործում եք մեծ լեզվի մոդելի կանխատեսումներ՝ հուշումն ինքնալրացնելու համար, այն բառերը, որոնք այն առաջացնում է, անսովոր սահուն են, հետաքրքրաշարժ և նույնիսկ օգտակար:

07:12.000 --> 07:21.000
Տարբերակներից մեկն այն է, որ ցատկենք խորը ուսուցման մասին իմ պատրաստած շարքի մեջ, որտեղ մենք պատկերացնում և մոտիվացնում ենք ուշադրության մանրամասները և բոլոր մյուս քայլերը տրանսֆորմատորում:

07:22.000 --> 07:28.000
Բայց նաև, իմ երկրորդ ալիքում, ես պարզապես տեղադրեցի մի ելույթ, որը ես տվել էի մի քանի ամիս առաջ այս թեմայի վերաբերյալ Մյունխենի TNG ընկերության համար:

07:28.000 --> 07:37.000
Երբեմն ես իրականում նախընտրում եմ այն ​​բովանդակությունը, որը ես պատրաստում եմ որպես սովորական խոսակցություն, այլ ոչ թե արտադրված տեսահոլովակ, բայց թողնում եմ ձեզ, թե դրանցից որն է ավելի լավ հաջորդող:






     Մեր մասին    Կապ                ©2021 «Հաղորդակցման և բանական տեխնոլոգիաների ազգային կենտրոն»