Qwen3.8-27B-OBLITERATED je komunitná úprava modelu Qwen3.8-27B od autora OBLITERATUS. Autor zasiahol do verejne dostupných váh tak, aby model menej odmietal požiadavky vrátane nebezpečných. Takýto model môže poslúžiť pri výskume bezpečnosti AI, autorizovanom red teamingu a lokálnych experimentoch. Do bežnej firemnej produkcie bez izolácie a vlastného testovania nepatrí.

Čo znamená OBLITERATED

Nejde o nový model od Qwen ani o oficiálnu verziu „bez cenzúry“. Slovo OBLITERATED v názve označuje zásah do vnútorných mechanizmov spojených s odmietaním požiadaviek.

Arditi a kolektív ukázali na 13 skúmaných chatovacích modeloch, že odmietanie možno ovplyvniť zásahom do určitého smeru vnútorných aktivácií. Autor Qwen3.8-27B-OBLITERATED uvádza, že použil agresívnejší variant s piatimi smermi identifikovanými pomocou SVD. Parametre zverejnil v súbore abliteration_metadata.json. Výskumná práca však neposudzovala tento konkrétny derivát, preto nepotvrdzuje jeho výsledky.

Podľa dokumentácie autora model zaznamenal nula tvrdých odmietnutí pri 842 škodlivých zadaniach. V teste MMLU s 285 otázkami mal dosiahnuť 81,4 %, kým pôvodný model 87,4 %. V repozitári neboli samostatné záznamy, z ktorých by sa tieto výsledky dali reprodukovať. Menší počet odmietnutí navyše neznamená presnejšie alebo pravdivejšie odpovede.

Čo sa s modelom dá robiť

Model možno spustiť lokálne. Repozitár ponúka plné váhy safetensors, kvantizované súbory GGUF a verzie MLX pre Apple Silicon. Najmenší priložený GGUF má 15,42 GB, ale počas behu treba ďalšiu pamäť pre aplikáciu, operačný systém a spracovaný kontext. llama.cpp podporuje rozdelenie výpočtu medzi GPU a CPU, hoci to môže model spomaliť.

Praktické white-hat použitie zahŕňa:

  • výskum toho, ako modely odmietajú rizikové požiadavky;
  • autorizovaný red teaming a interné bezpečnostné testy AI systémov;
  • porovnávanie s neupraveným Qwen3.8-27B;
  • lokálne experimentovanie bez prístupu k citlivým dátam a účtom.

Pôvodný Qwen3.8-27B podporuje text, obraz a video, no dokumentácia derivátu neuvádza samostatné testy obrazu ani videa. Tieto schopnosti preto nemožno automaticky považovať za overené aj po úprave.

Kto ho môže používať

Výskumníci, bezpečnostné tímy a technicky skúsení používatelia ho môžu skúšať v kontrolovanom prostredí. Firma by mala použiť oddelený testovací počítač alebo sandbox bez prístupu k produkčnému e-mailu, databázam, shellu, cloudovým účtom a zákazníckym dátam. Testy majú prebiehať iba na systémoch, na ktoré má tím oprávnenie.

Bežný používateľ ho môže skúsiť ako lokálny model, ak rozumie hardvérovým nárokom a dokáže obmedziť jeho prístup. Nie je vhodný pre človeka, ktorý očakáva hotového asistenta s rovnakými ochrannými mechanizmami ako pri bežnej verejnej AI službe.

Model môže zneužiť aj black-hat aktér, pretože oslabené odmietanie odstraňuje jednu z ochranných vrstiev. To nie je odporúčanie na škodlivé použitie. Je to dôvod nepripájať model bez obmedzení k nástrojom alebo produkčným systémom.

Derivát deklaruje Apache License 2.0, ktorá pri splnení podmienok umožňuje používanie, úpravy a distribúciu vrátane komerčných projektov. Licencia však nie je bezpečnostná certifikácia. Pre firmu je tento model vhodný nanajvýš ako izolovaný experiment, nie ako nekontrolovaný produkčný chatbot alebo agent.