Meta pod ostrzałem za manipulowanie testem Llama 4: Nie jest to ich pierwsze przewinienie

Meta pod ostrzałem za manipulowanie testem Llama 4: Nie jest to ich pierwsze przewinienie

Meta niedawno opublikowała swoje modele AI LLAMA 4, które znalazły się w nagłówkach GPT-4O i Gemini 2.0 Pro w Chatbot Arena (wcześniej LMSYS). Firma twierdziła, że ​​jej model Maverick LLAMA 4 – model MOE, który aktywuje zaledwie 17 miliardów parametrów z ogromnych 400B u 128 ekspertów – uzyskał imponujący wynik ELO wynoszący 1 417 na punkcie Benchmark Chatbot Arena.

Wynik ten podniósł brwi w społeczności AI, ponieważ stosunkowo mniejszy model MOE przewyższył znacznie większe LLM, takie jak GPT-4.5 i GROK 3. Niezwykłe wydajność małego modelu, które wielu prowadziło do społeczności AI do niezależnego przetestowania modelu. Zaskakujące jest to, że prawdziwy występ Llama 4 Maverick nie pasował do roszczeń Benchmark od Meta, szczególnie w Zadania kodujące.

NA 1Point3acrespopularne forum dla Chińczyków w Ameryce Północnej, użytkownik, który twierdzi, że jest byłym pracownikiem meta, opublikował bombę. Według postu, który został przetłumaczony na angielski RedditMeta kierownictwo rzekomo wymieszało „Zestawy testowe różnych punktów odniesienia w procesie po treningu” w celu zawyżenia wyniku testu porównawczego i osiągnięcia wewnętrznych celów.

Meta pracownik uznał tę praktykę za niedopuszczalną i postanowił zrezygnować. Były pracownik poprosił również zespół o wykluczenie nazwy z raportu technicznego LLAMA 4. W rzeczywistości użytkownik twierdzi, że niedawna rezygnacja szefa AI Research, Joelle Pineau, jest bezpośrednio powiązana z hakowaniem Benchmark Llama 4.

W odpowiedzi na rosnące zarzuty Ahmad al-Dahle, szef generatywnego działu AI Meta, podzielił Post na x. Mocno odrzucił twierdzenie, że LAMA 4 został po szkoleniu na zestawach testowych. Al-Dahle pisze:

Słyszeliśmy również twierdzenia, że ​​przeszkoliliśmy zestawy testowe – to po prostu nieprawda i nigdy tego nie zrobilibyśmy. Najlepsze zrozumienie jest to, że zmienna jakość, którą widzą ludzie, wynika z konieczności stabilizacji implementacji.

Uznał niespójny wydajność Lamy 4 na różnych platformach. I wezwał także społeczność AI, aby dała jej kilka dni, aby wdrożyć „wybranie”.

LMSYS odpowiada na zarzuty manipulacji Benchmark 4 LAMA 4

Zgodnie z obawami AI Community, LMSYS – organizacji stojącej za liderem Chatbot Arena – wydała oświadczenie w celu poprawy przejrzystości. LMSYS wyjaśnił, że przesłany model na Chatbot Arena był „LLAMA-4-Maverick-03-26-Experimental”. Był to niestandardowy wariant modelu, zoptymalizowany pod kątem preferencji ludzkich.

LMSYS przyznał, że „styl i ton reakcji modelu był ważnym czynnikiem”. Może to dać nieuzasadnioną przewagę niestandardowi Modelowi Maverick LAMA 4. Organizacja przyznała również, że informacje te nie zostały wystarczająco wyjaśnione przez zespół meta. Ponadto LMSY stwierdził: „Interpretacja naszej polityki przez meta nie pasowała do tego, czego oczekujemy od dostawców modeli”.

Przeczytaj także:

10 najlepszych modeli dużych języków (LLM) w 2025

Aby być uczciwym, Meta, w swoim urzędniku Blog LLAMA 4wspomniał, że „eksperymentalna wersja czatu” uzyskała 1417 na chatbot Arena. Ale nie wyjaśnili niczego dalej.

Wreszcie, aby poprawić przejrzystość, LMSYS dodał wersję Llama 4 Maverick do Chatbot Arena. Poza tym opublikował ponad 2000 wyników bitew dla publiczności do przeglądu. Wyniki obejmują podpowiedzi, odpowiedzi modelu i preferencje użytkownika.

Sprawdziłem Wyniki bitwyi zaskakujące było, że użytkownicy konsekwentnie preferują często niepoprawne i nadmiernie poważne odpowiedzi. Rodzi to głębsze pytania dotyczące zaufania odniesień opartych na społeczności, takich jak chatbot Arena.

Nie po raz pierwszy meta gier testów porównawczych

To nie jest pierwszy raz, gdy meta została oskarżona o odniesienia do gier poprzez zanieczyszczenie danych, tj. Mieszanie zestawów danych porównawczych w korpusie szkoleniowym. W lutym tego roku Susan Zhang – były badacz Meta AI, który teraz pracuje w Google Deepmind – podzielił się odkrywczym badaniem w odpowiedzi na post Yanna LeCuna, głównego naukowca Meta AI.

. badanie stwierdzono, że ponad 50% próbek testowych z kluczowych punktów odniesienia było obecnych w danych pretrainingowych Meta Lama 1. Artykuł mówi: „W szczególności Big Bench Hard, Humaneval, Hellaswag, MMLU, Piqa i Triviaqa wykazują znaczne poziomy zanieczyszczenia w obu korporach”.

Teraz, pośród najnowszych zarzutów hakowania w Lamie 4, Zhang ma sarkastycznie znakomity Ta meta powinna przynajmniej przytoczyć swoją „poprzednią pracę” z Lamy 1 dla tego „unikalnego podejścia”. JAB jest skierowany do meta, że ​​manipulacja porównawcza nie jest wypadkiem. Ale jest to strategia firmy prowadzonej przez Zuckerberg, aby sztucznie zwiększyć wskaźniki wydajności.

Wesprzyj naszą pracę ❤️

Jeśli spodobał Ci się ten artykuł, rozważ pozostawienie napiwku, aby pomóc nam dalej publikować wartościowe treści.

Bezpieczna płatność przez PayPal
Zobacz także:  Kierowcy elektryków z Massachusetts mogą sprzedawać energię do sieci w ramach nowego programu