Qwen3.8-27B-OBLITERATED je komunitná úprava modelu Qwen3.8-27B od autora OBLITERATUS. Autor zasiahol do verejne dostupných váh tak, aby model menej odmietal požiadavky vrátane nebezpečných. Takýto model môže poslúžiť pri výskume bezpečnosti AI, autorizovanom red teamingu a lokálnych experimentoch. Do bežnej firemnej produkcie bez izolácie a vlastného testovania nepatrí.
Čo znamená OBLITERATED
Nejde o nový model od Qwen ani o oficiálnu verziu „bez cenzúry“. Slovo OBLITERATED v názve označuje zásah do vnútorných mechanizmov spojených s odmietaním požiadaviek.
Arditi a kolektív ukázali na 13 skúmaných chatovacích modeloch, že odmietanie možno ovplyvniť zásahom do určitého smeru vnútorných aktivácií. Autor Qwen3.8-27B-OBLITERATED uvádza, že použil agresívnejší variant s piatimi smermi identifikovanými pomocou SVD. Parametre zverejnil v súbore abliteration_metadata.json. Výskumná práca však neposudzovala tento konkrétny derivát, preto nepotvrdzuje jeho výsledky.
Podľa dokumentácie autora model zaznamenal nula tvrdých odmietnutí pri 842 škodlivých zadaniach. V teste MMLU s 285 otázkami mal dosiahnuť 81,4 %, kým pôvodný model 87,4 %. V repozitári neboli samostatné záznamy, z ktorých by sa tieto výsledky dali reprodukovať. Menší počet odmietnutí navyše neznamená presnejšie alebo pravdivejšie odpovede.
Čo sa s modelom dá robiť
Model možno spustiť lokálne. Repozitár ponúka plné váhy safetensors, kvantizované súbory GGUF a verzie MLX pre Apple Silicon. Najmenší priložený GGUF má 15,42 GB, ale počas behu treba ďalšiu pamäť pre aplikáciu, operačný systém a spracovaný kontext. llama.cpp podporuje rozdelenie výpočtu medzi GPU a CPU, hoci to môže model spomaliť.
Praktické white-hat použitie zahŕňa:
- výskum toho, ako modely odmietajú rizikové požiadavky;
- autorizovaný red teaming a interné bezpečnostné testy AI systémov;
- porovnávanie s neupraveným Qwen3.8-27B;
- lokálne experimentovanie bez prístupu k citlivým dátam a účtom.
Pôvodný Qwen3.8-27B podporuje text, obraz a video, no dokumentácia derivátu neuvádza samostatné testy obrazu ani videa. Tieto schopnosti preto nemožno automaticky považovať za overené aj po úprave.
Kto ho môže používať
Výskumníci, bezpečnostné tímy a technicky skúsení používatelia ho môžu skúšať v kontrolovanom prostredí. Firma by mala použiť oddelený testovací počítač alebo sandbox bez prístupu k produkčnému e-mailu, databázam, shellu, cloudovým účtom a zákazníckym dátam. Testy majú prebiehať iba na systémoch, na ktoré má tím oprávnenie.
Bežný používateľ ho môže skúsiť ako lokálny model, ak rozumie hardvérovým nárokom a dokáže obmedziť jeho prístup. Nie je vhodný pre človeka, ktorý očakáva hotového asistenta s rovnakými ochrannými mechanizmami ako pri bežnej verejnej AI službe.
Model môže zneužiť aj black-hat aktér, pretože oslabené odmietanie odstraňuje jednu z ochranných vrstiev. To nie je odporúčanie na škodlivé použitie. Je to dôvod nepripájať model bez obmedzení k nástrojom alebo produkčným systémom.
Derivát deklaruje Apache License 2.0, ktorá pri splnení podmienok umožňuje používanie, úpravy a distribúciu vrátane komerčných projektov. Licencia však nie je bezpečnostná certifikácia. Pre firmu je tento model vhodný nanajvýš ako izolovaný experiment, nie ako nekontrolovaný produkčný chatbot alebo agent.



