Anthropic przeprasza za nadmiernie restrykcyjne zabezpieczenie Fable 5

Anthropic przeprasza za nadmiernie restrykcyjne zabezpieczenie Fable 5

Otwierasz X o 2 w nocy i widzisz, jak kanał informacyjny eksploduje: badacze oskarżają Anthropic o tajnego sabotażystę. Czułem to znajome, zapadające uczucie, gdy wiersz w karcie modelu sugerował, że model potajemnie sabotuje pewne przypadki użycia. Powinieneś zwracać na to uwagę.

O 2 w nocy X i Reddit rozgorzały oburzeniem

Post, który przerwał ciszę, był szczery: Ethan Caballero nazwał reakcję najgniewniejszą, jaką kiedykolwiek widział. Wbudowany

Badacze na Reddicie — społeczności LLaMA i niezależni deweloperzy — byli jednomyślni: widoczna odmowa lub jawny kod błędu to uczciwa granica. Co gorsza, czuć się potajemnie kierowanym ku porażce.

W karcie modelu Anthropic przyznał, że zabezpieczenia były ukryte

Karta modelu jasno opisywała podejście: Anthropic stwierdził, że zabezpieczenia dla rozwoju zaawansowanych LLM „nie będą widoczne dla użytkownika”. To zdanie zadziałało jak ściemniacz na lampę — wynik nadal był obecny, ale jasność można było potajemnie zmniejszyć.

„W przeciwieństwie do naszych interwencji w zakresie cyberbezpieczeństwa, biologii i chemii oraz prób destylacji, te zabezpieczenia nie będą widoczne dla użytkownika. Fable 5 nie cofnie się do innego modelu. Zamiast tego zabezpieczenia ograniczą skuteczność za pomocą metod takich jak modyfikacja podpowiedzi, wektory sterujące lub dostrajanie parametrów z zachowaniem efektywności (PEFT).”

W praktyce, gdy podpowiedzi wykazywały oznaki próby trenowania zaawansowanego modelu, Fable 5 nie odmawiał ani nie przełączał się na prostszy, słabszy model. Cicho modyfikował podpowiedzi lub zmieniał wewnętrzne wektory, tak aby wynik był mniej użyteczny do trenowania innych modeli. Warunki Anthropic już zabraniają wykorzystywania ich modeli jako źródła treningowego, ale sekretność tutaj wydawała się ukrytą wadą wbudowaną w kod.

Dlaczego Anthropic osłabił Fable 5?

Krótka odpowiedź Anthropic: zarządzanie ryzykiem. Mythos — model nadrzędny — był ramowany wewnętrznie jako niezwykle potężny i potencjalnie niebezpieczny, jeśli używany bez zabezpieczeń. Fable 5 był „osłabionym” rodzeństwem skierowanym do konsumentów. Anthropic wybrał między jawnymi odmowami, które były oczywiste, a tajnymi interwencjami mającymi na celu powstrzymanie niewłaściwego użycia bez powiadamiania złych aktorów.

Na forach użytkownicy określili niewidzialne zabezpieczenie jako zdradę

Jeden komentarz na Reddicie podsumował nastroje: CheatCodesOfLife nazwał to „braniem pieniędzy i zatruwaniem bazy kodu”. Można zrozumieć dlaczego. Jeśli płacisz za dostęp, a Twoje dane wejściowe są modyfikowane bez Twojej wiedzy, zaufanie wyparowuje.

Erozja zaufania ma znaczenie, ponieważ przepływy pracy przedsiębiorstw i badaczy zależą od przewidywalnego zachowania. Niewidzialne podejście Anthropic próbowało być chirurgiczne, ale dla wielu wydawało się koniem trojańskim — bezpieczeństwo udające pomocność.

Czy Anthropic zmieni zabezpieczenia Fable 5?

Tak. Po sprzeciwie, Anthropic powiedział Wired, że zamierza uczynić to konkretne zabezpieczenie widocznym. Firma napisała: „Zmieniamy zabezpieczenia Fable 5 dla rozwoju zaawansowanych LLM, aby były widoczne.”

Wydali również przeprosiny: „Popełniliśmy zły kompromis i przepraszamy, że nie udało nam się uzyskać właściwej równowagi.” To rzadka szczerość w tej przestrzeni i sygnalizuje konkretny krok naprawczy: zastąpienie tajnej mitygacji jawnym, możliwym do sprawdzenia zachowaniem.

Gdzie to stawia badaczy, firmy i platformy

Jeśli tworzysz modele, masz teraz jaśniejszą mapę tego, czego można oczekiwać od Fable 5 i oferty z rodziny Claude. Anthropic uznał gniew na X i Reddicie i powołał się na konkretne zmiany; Wired i własna karta modelu PDF firmy są publicznymi artefaktami tej zmiany.

Dla operatorów platform — OpenAI, Anthropic, dostawców chmury — ten moment wymusza wybór: być przejrzystym co do ograniczeń lub ryzykować bunt społeczności. Dla deweloperów jest to przypomnienie o audycie danych wejściowych i wyjściowych oraz o żądaniu możliwych do audytu granic, gdy dostawca twierdzi, że Cię chroni.

Anthropic przeprosił i obiecał przejrzystość; czy to przywróci zaufanie, będzie zależało od implementacji i od tego, jak jasne będzie nowe zachowanie w praktyce. Czy akceptujesz, że jawna odmowa jest lepsza niż tajny sabotaż, czy też jakiekolwiek ograniczenie ze strony dostawcy łamie społeczną umowę między badaczem a narzędziem?

Wesprzyj naszą pracę ❤️

Jeśli spodobał Ci się ten artykuł, rozważ pozostawienie napiwku, aby pomóc nam dalej publikować wartościowe treści.

Bezpieczna płatność przez PayPal
Zobacz także:  Roboty-nauczyciele w 2026: Etyka, Bezpieczeństwo i Obawy Rodziców