Jump to content

Strojové učení

From mediawiki.org
This page is a translated version of the page Machine Learning and the translation is 100% complete.

Vítejte na domovské stránce týmu strojového učení Wikimedia Foundation.

Náš tým dohlíží na vývoj a správu modelů strojového učení pro koncové uživatele a také na infrastrukturu potřebnou pro návrh, školení a nasazení těchto modelů.

Aktuální projekty

Archivované projekty naleznete v v tomto seznamu.

Kontaktujte nás

Máte dotaz? Chcete si promluvit s týmem nebo naší komunitou dobrovolníků o strojovém učení? Zde jsou nejlepší způsoby, jak se s námi spojit.

Týmový chat

Diskutujte o strojovém učení a sledujte práci týmu, který se připojí k našemu veřejnému IRC chatu #wikimedia-ml připojit se na irc.libera.chat.

Aktivní pracovní plocha

Máte konkrétní úkol, o kterém chcete diskutovat nebo na kterém chcete pracovat? Připojte se k naší veřejné nástěnce Phabricator . Navštivte naši pracovní plochu

Co je nového?

    • Pokračujeme v integraci modelu article-country (článek-země) do Liftwingu. Model článku podle země předpovídá, pro které země bude konkrétní model použitelný, a je rozšířením modelu článku podle tématu, který používáme již léta.
    • Zkoušíme různé přístupy k vytvoření vllm (vysoce výkonný a paměťově efektivní systém určený pro obsluhu velkých jazykových modelů) a ROCm (kód, který umožňuje CPU komunikovat s GPU AMD) s Ubuntu. Toto je součást práce na umožnění produkčních LLM na platformě Liftwing.
    • Momentálně pracujeme na konfiguraci serverů ML Lab. Ty jsou určeny pro trénování modelů.
    • Aktualizován model nasazení obrázku rec-api. Nasazení modelu referenčních potřeb do produkčního prostředí.
    • Řešení opakovaného problému hlášeného týmem pro strukturovaný obsah: Rozhraní MediaDetection API má přístup ke koncovému bodu pro detekci loga přes mwdebug1001.eqiad.wmnet a mwdebug2001.codfw.wmnet, ale nemůže k němu přistupovat na k8s-mwdebug.
    • Přidání dokumentace k detekci log do dokumentace portálu API.
    • Zkoumání občasných pomalých dotazů na LiftWing při použití některých modelů RevScoring
    • Pokračování zbývající práce na modelu revertrisk před uložením. Tento model je navržen tak, aby poskytoval predikci vandalismu před uložením úpravy na Wikipedii (a proto nemá ID revize).
    • Práce na aktualizaci kserve na verzi 0.13 pokračují.
    • Inicializace instalační konfigurace pro hostitele GPU v eqiad
    • Omlouvám se z mé strany za zpoždění aktualizací, mám covid.
    • Pokračuje práce na modelu detekce log. Vytvořili jsme příklad serveru s modelem detekce log, který zpracovává obrázkové objekty v base64 namísto URL adres obrázků, a zaslali jsme ho týmu pro strukturovaný obsah k vyjádření.
    • Práce na modelovém serveru HuggingFace pokračují.
    • Obecné opravy chyb a vylepšení.
    • Práce na modelu detekce loga pokračuje. Tento týden jsme v týmu diskutovali o tom, zda bude kódovaný obrázek odeslán přímo do LiftWingu. Alternativně bychom obdrželi URL adresu umístění obrázku, ke které bychom pak LiftWingu umožnili přístup/stahování. To je důležité, protože to ovlivňuje velikost datového zatížení REST, zejména u dávkových požadavků.
    • Stále pracujeme na problému s grafickou kartou serveru modelu HuggingFace (tj. nerozpozná naši grafickou kartu AMD). Existuje několik možností, proč to tak je, ale chceme to vyřešit před dokončením naší objednávky pro tento fiskální rok.
    • Řada oprav různých chyb a vylepšení.
    • Náš velký refaktoring Istio právě probíhá (slajdy)! Tento refaktoring nám umožní odstranit z jednotlivých kontejnerů modelů spoustu síťové logiky. Například v současné době, pokud by došlo ke změně koncového bodu discovery.wmnet (interní koncový bod WMF pro API), museli bychom aktualizovat stovky jednotlivých kontejnerů modelů a znovu je nasadit. Tato refaktorizace tuto potřebu zcela odstraňuje.
    • Do každého uzlu k8s jsme nasadili open source software stack (ROCm) od AMD, ale máme podezření, že to bylo zbytečné (a ve skutečnosti to způsobovalo určité problémy), protože PyTorch již má verzi ROCm zahrnutou v knihovně. Této práci dáváme prioritu, protože její dokončení je nezbytné pro realizaci velké objednávky GPU, kterou jsme plánovali na konec čtvrtletí.
    • Připravujeme patch, který umožní serveru modelu detekce loga přístup k externím URL pomocí interních koncových bodů k8s. Toto je součást změn, které jsme museli provést pro nasazení modelu.
    • Pokračujeme v testování serverového obrazu modelu HuggingFace na našich uzlech Lift Wing. Tato práce byla na týden pozastavena, protože se inženýr zúčastnil hackathonu Wikipedie v Tallinnu.
    • Práce na ukládání do mezipaměti Lift Wing byla pozastavena do dokončení refaktoringu Istio.
    • Provádím kontrolu a testování velké záplaty pro rozšíření ORES. Rozšíření ORES umožňuje zobrazit pravděpodobnost, že bude konkrétní úprava vrácena zpět, a to u všech úprav na stránce posledních změn mnoha Wiki. Nový model rizika vrácení zpět do rozšíření umožňuje dobrovolníkům využívat tento nový model při odhalování potenciálního vandalismu.
    • Stále pracujeme na úpravách zpracování obrázků pro model detekce loga, konkrétně omezujeme zpracování obrázků na důvěryhodné domény, které hostují obrázky komentářů Wikimedie.
    • Diskutujeme o velkém návrhu na refaktoring Istio (Istio je servisní síť pro K8, která řídí, jak mikroslužby sdílejí data mezi sebou). V úterý bude mít tým speciální schůzku, kde probere navrhovaný refaktoring a rozhodne o dalším postupu. Pokud by někdo měl zájem, zveřejním slajdy příští týden.
    • Model detekce loga se přesouvá do experimentálního jmenného prostoru. To bude okamžik, kdy budeme moci model otestovat v produkčním prostředí, abychom se ujistili, že má požadovaný výkon. Tato práce je úzce koordinována s týmem pro strukturovaný obsah, abychom se ujistili, že splňuje jejich potřeby.
    • Tento týden začal sprint zaměřený na strojové učení a výzkum Airflow Pipeline. Cílem je zjistit, jak můžeme využít Airflow Pipeline a GPS na stávajícím Hadoop clusteru k trénování modelů.
    • Pokračují práce na clusterech Cassandra, které budou součástí řešení pro ukládání do mezipaměti.
    • Pokračují práce na serverovém obrazu modelu Hugging Face. Jde o projekt, na kterém pracujeme a který nám umožní snadno hostovat mnoho modelů dostupných na Hugging Face přímo na Lift Wing. Je to vlastně opravdu zajímavý projekt, protože je to snadný způsob, jak může komunita experimentovat s modely, které by chtěla hostovat na Lift Wing, a dokonce navrhovat modely, které by na Lift Wing mohla chtít mít.
    • Spolupracujeme s provozním týmem datového centra na pořízení nových strojů s grafickými kartami. Aktuální stav je takový, že s dodavatelem pracujeme na problému s dostupností konkrétní konfigurace serveru a hledáme alternativy.
    • Chris na dovolené. Tento týden žádné novinky.
    • Velké vítězství týdne: Náš HuggingFace záplata pro obraz Dockeru byl zkontrolován a schválen. Tato image Dockeru nám umožňuje rychle nasadit modely HuggingFace na LiftWing, což urychlí veškerý další vývojový proces.
    • Pokračování integrace prototypu detekce loga do vlastního modelového serveru KServe, který bude hostován na LiftWingu.
    • Práce na obrazu GPU revertrisk-multilingual, zajištění kompatibility modelu RRML s Torch 2.x (např. předpovědi jsou správné, protože model byl trénován s verzí 1.13).
    • Stále pracujeme na modelu detekce log pro Wikimedia Commons. Aktuální stav je takový, že jsme s produktovým týmem pracujícím na této funkci potvrdili, že model vrací očekávané výstupy. Dalším krokem je podívat se na validaci vstupu a limity velikosti obrázku. Otevřenou otázkou, kterou probíráme s produktovým týmem, je, zda by se změna velikosti obrázků měla provádět uvnitř Lift Wingu, nebo před odesláním obrázku do Lift Wingu. Změna velikosti je důležitá, protože model detekce loga očekává obrázek určité velikosti.
    • Práce / mlácení hlavou pokračuje na základním obrázku z PyTorchu. Pro ty, kteří nás sledují, spolupracujeme se Service Ops na vytvoření obrazu Dockeru o rozumné velikosti, který bude obsahovat podporu PyTorchu a ROCm. Pokud je základní obraz příliš velký, stává se to problémem pro náš registr Dockeru a my se snažíme být dobrými správci tohoto společného zdroje. Ukázalo se, že je to těžší, než jsme si mysleli.
    • Na ukládání do mezipaměti Lift Wing se stále pracuje. Stále řešíme, jak má Lift Wing (konkrétně Istio od KServe) komunikovat se servery Cassandra.
    • Nová verze modelu Language Agnostic Revert Risk byla nasazena do testovací verze a v současné době probíhá zátěžové testování.
    • Více práce na integraci modelového serveru HuggingFace s Lift Wing. Jakmile to rozluštíme, budeme moci rychle nasadit většinu modelů na HuggingFace.
    • Tento týden jsme založili komunitu praktiků strojového učení na Wikimedii. Cílem je poskytnout prostor všem lidem ve WMF, kteří pracují na technické stránce strojového učení, aby si mohli sdílet poznatky a společně se učit. V současné době jsou v komunitě praktiků lidé z řady týmů, včetně ML, výzkumu, překladu obsahu a dalších.
    • Stále čekáme na instalaci našich testovacích GPU (jeden server se dvěma MI210) v datovém centru. Jakmile otestujeme, zda tato konfigurace funguje v naší infrastruktuře (maximálně několik dní testování), můžeme pokračovat s kompletní objednávkou.
    • Začínám pracovat na bílé knize, která shrnuje veškerou práci, kterou Wikimedia'verse dělá v oblasti umělé inteligence, včetně modelů hostitelů WMF, advokační práce WMF, práce dobrovolníků atd. Pokud znáte někoho, s kým bych si měl promluvit, určitě se ozvěte.
    • Opravdu usilovně pracujeme na nasazení ukládání do mezipaměti. Důvodem je, že díky ukládání do mezipaměti můžeme skutečně plně využít procesory, které nyní máme, a to předběžným ukládáním predikcí do mezipaměti. Konečným výsledkem pro uživatele je, že predikce, která by mohla trvat 500 ms, by trvala zlomek této doby. Přesný aktuální stav práce je takový, že se naše SRE snaží přimět Lift Wing, aby komunikovalo se servery Cassandra.
    • Naše SLO pracovní plochy potřebují opravit. Ukazují divoká čísla, která jsou evidentně nesprávná. Náš tým pracuje s lidmi, aby to zjistili.
    • Práce na modelu detekce loga pokračuje. Žádost o hostování tohoto modelu pochází od týmu pro strukturovaný obsah. Cílem je předpovídat loga ve Wikimedia Commons, protože loga tvoří významnou část souborů, které obdrží žádost o smazání.
    • Pokračujeme v pokusech o načtení modelového serveru HuggingFace do Lift Wing. Po dokončení toto nabídne možnost rychlého a snadného načtení modelu hostovaného na HuggingFace do Lift Wing, čímž se otevře obrovská nová knihovna modelů, které mohou lidé používat.
    • Pracujeme na nasazení modelu pro tým strukturovaného obsahu, který detekuje potenciálně autorsky chráněné obrázky nahrané na Commons, konkrétně obrázky s logy. (T358676)
    • Pokračujeme v práci na hostování modelového serveru HuggingFace na platformě Lift Wing. Díky tomu by nasazení modelů HuggingFace bylo velmi jednoduché.
    • Nasadili jsme mezipaměť Dragonfly na Lift Wing, která pomáhá s velikostmi obrázků Dockeru.
    • Naše databáze Cassandra pro případný systém mezipaměti jsou v produkčním prostředí. Ještě je co dělat, ale je to dobrý začátek.
    • Obecné aktualizace a opravy chyb.
    • Omlouvám se za denní zpoždění aktualizace, Chris (já) jsem se zúčastnil strategické schůzky v New Yorku a píšu tuto aktualizaci z letadla zpět.
    • Problém, se kterým se potýkáme, je, že registr Dockeru WMF je nastaven pro menší obrazy Dockeru (~2 GB). Obrazy Dockeru týmu se však mohou kvůli ROCm/PyTorch docela zvětšit (~6-8 GB). Pracujeme na tom, jak to vyřešit. Existuje řada strategií, od optimalizace vrstev obrazů až po požadavek na zvýšení maximálního limitu velikosti obrazu Dockeru.
    • Jako částečné řešení výše uvedeného jsme nainstalovali Dragonfly, což je peer-2-peer vrstva mezi naším clusterem Kubernetes a registrem Docker WMF. Budeme také pracovat na některých dalších vylepšeních.
    • Pokračujeme v práci na začlenění předpřipraveného modelového serveru HuggingFace do Lift Wing. To by znamenalo, že bychom mohli rychle nasadit jakýkoli model na HuggingFace se všemi optimalizacemi, které HuggingFace poskytuje. (T357986) To ještě není hotové, ale bylo by opravdu fajn to mít.
    • Oprava chyby týkající se nekonzistentního datového typu pro hodnocení kvality článků na ptwiki. Chyba byla způsobena smíšeným schématem odpovědí vrácených ORES. (T358953)
    • Požadovali jsme hardware pro servery na příští fiskální rok. Zkráceně: GPU.
    • Objednávka GPU je v plném proudu. Právě objednáváme sérii serverů, které budeme používat pro trénování a inferenci. Každý server bude mít dvě grafické karty AMD MI210. Většina bude vyhrazena pro odvozování modelů (konkrétně větší modely jako LLM), ale k vytvoření trénovacího prostředí pro model použijeme dva servery (4 GPU). Toto prostředí pro trénování modelů začne velmi malé a nekonzistentní, ale doufejme, že se rozroste v místo pro automatizované přetrénování modelů a standardizaci přístupů k trénování modelů. Dalším krokem je odeslání jednoho serveru do našeho datového centra a po jeho otestování provedeme kompletní objednávku.
    • Práce na ukládání do mezipaměti pro Lift Wing pokračuje. Právě vyrábíme velkou objednávku grafických karet (GPU). Nicméně pro optimalizaci využití zdrojů je jednou z nejlepších strategií, kterou můžeme udělat, provádět inferenci modelu s využitím našich stávajících CPU. To není vždy možné, například v případech, kdy množina možných vstupů modelu není konečná. V případech, kdy jsou možné vstupy konečné, však můžeme ukládat predikce pro tyto vstupy do mezipaměti a poté je rychle zprostředkovat uživatelům s minimálními výpočetními náklady. Jedná se o podobný systém, jaký byl původně použit na ORES.
    • Penetrační testování systému Lift Wing pokračuje. Testování provádí externí dodavatel a zkoumá naši zranitelnost vůči škodlivému kódu.
    • Tým pro branding Wikimedie přišel s několika návrhy na pojmenování nástrojů a modelů strojového učení. Doufáme, že naše pojmenování bude systematičtější a méně improvizované.
    • Chris pomohl zorganizovat a zúčastnit se akce v italském Bellagiu, jejímž cílem bylo vytvořit výzkumný program pro badatele zajímající se o Wikipedii. Tento výzkumný program je k dispozici zde m:Artificial intelligence/Bellagio 2024.