Modele generowania tekstu na obraz oparte na sztucznej inteligencji są wszędzie i stają się coraz łatwiejsze do uzyskania z dnia na dzień. Podczas gdy łatwo jest po prostu odwiedzić stronę internetową i wygenerować obraz, którego szukasz, generatory tekstu na obraz z otwartym kodem źródłowym są najlepszym rozwiązaniem, jeśli chcesz mieć większą kontrolę nad procesem generowania.
W Internecie dostępnych jest wiele darmowych i otwartych generatorów AI text-to-image, które specjalizują się w określonych rodzajach obrazów. Przeszukaliśmy więc stos i znaleźliśmy najlepsze otwarte generatory AI text-to-image, które możesz wypróbować już teraz.
1Kredka
Craiyon jest jednym z najłatwiej dostępnych generatorów obrazów AI typu open source. Opiera się na DALL-E Mini, a chociaż możesz sklonować repozytorium Github i zainstalować model lokalnie na swoim komputerze, Craiyon najwyraźniej porzucił to podejście na rzecz swojej witryny.
Oficjalne repozytorium Github nie było aktualizowane od czerwca 2022 r., ale najnowszy model jest nadal dostępny bezpłatnie na oficjalnej stronie Craiyon. Nie ma również aplikacji na Androida ani iOS.
Jeśli chodzi o funkcjonalność, zobaczysz wszystkie typowe opcje, których oczekujesz od generatora obrazów AI. Po wprowadzeniu monitu i otrzymaniu obrazu możesz użyć funkcji upscale, aby uzyskać kopię o wyższej rozdzielczości. Do wyboru są trzy style: Art, Photo i Drawing. Możesz również wybrać opcję „None”, jeśli chcesz, aby model decydował.

Ponadto „Tryb ekspercki” pozwala na dodawanie słów negatywnych, co mówi modelowi, aby unikał określonych elementów. Jest też funkcja przewidywania podpowiedzi, która używa ChatGPT, aby pomóc użytkownikom pisać najlepsze, najbardziej szczegółowe podpowiedzi. Na koniec, funkcje usuwania tła oparte na sztucznej inteligencji mogą pomóc Ci zaoszczędzić czas i wysiłek przy przycinaniu tła z obrazów.
I to jest mniej więcej wszystko, co robi Craiyon. To nie jest najbardziej zaawansowany model generowania obrazów AI, ale sprawdza się jako podstawowy model, jeśli nie chcesz czegoś szczegółowego lub realistycznego.
Model jest darmowy w użyciu, ale użytkownicy bezpłatni są ograniczeni do dziewięciu darmowych obrazów na raz w ciągu minuty. Możesz subskrybować poziomy Supporter lub Professional (odpowiednio w cenie 5 USD i 20 USD miesięcznie, rozliczane rocznie), aby nie otrzymywać reklam ani znaków wodnych, szybciej generować i mieć możliwość zachowania prywatności generowanych obrazów. Poziom subskrypcji Custom umożliwia również niestandardowe modele, integrację, dedykowane wsparcie i prywatne serwery.
2Stabilna dyfuzja 1,5
Stable Diffusion jest prawdopodobnie jednym z najpopularniejszych modeli generowania tekstu na obraz typu open source. Obsługuje również inne modele, w tym trzy generatory obrazów wymienione poniżej. Został wydany w 2022 r. i od tego czasu miał wiele implementacji.

Oszczędzę ci zbyt technicznych szczegółów działania modelu (które możesz sprawdzić w oficjalnym repozytorium Github), ale model jest łatwy w instalacji nawet dla zupełnych nowicjuszy i działa dobrze, o ile masz dedykowany procesor graficzny z co najmniej 4 GB pamięci. Możesz również uzyskać dostęp do Stable Diffusion online, a my mamy dla ciebie rozwiązanie, jeśli chcesz uruchomić Stable Diffusion na komputerze Mac.
Istnieje kilka punktów kontrolnych (rozważ je jako wersje) dostępnych do użycia dla Stable Diffusion. Podczas gdy testowaliśmy wersję 1.5, wersja 2.1 jest również aktywnie rozwijana i jest bardziej precyzyjna.

Uruchomienie modelu jest również dość proste. Przetestowaliśmy go za pomocą interfejsu użytkownika AUTOMATIC1111 Stable Diffusion, a wszystkie kontrolki i parametry działają dobrze. Jest on również dość odporny na treści NSFW dzięki bazie danych LAION-5B, na której trenowano model (choć nie jest idealny, zauważ). Podczas gdy sam czas generowania będzie się różnić w zależności od sprzętu, możesz oczekiwać, że obrazy będą szczegółowe i realistyczne nawet przy podstawowych monitach.
3Kształtujący marzenia
DreamShaper to model generowania obrazu oparty na Stable Diffusion. Został pomyślany jako alternatywa open-source dla MidJourney i koncentruje się na fotorealizmie w generowanych obrazach, chociaż radzi sobie równie dobrze z anime i stylami malarstwa po kilku poprawkach.
Model ten jest bardziej wydajny niż Stable Diffusion, dając użytkownikom większą swobodę w kwestii końcowego wyniku, od błyskawicznych ulepszeń po luźniejsze ograniczenia NSFW. Uruchomienie modelu jest również łatwe, dzięki dostępnej do pobrania, wstępnie wytrenowanej wersji online do lokalnego dostępu i wielu witrynom, w tym Sinkin.ai, RandomSeed i Mage.space (wymaga podstawowej subskrypcji), które umożliwiają uruchomienie modelu z przyspieszeniem GPU.

Jak zapewne już zgadłeś, obrazy generowane przez DreamShaper wydają się bardziej realistyczne w porównaniu do Stable Diffusion. Nawet jeśli uruchomisz ten sam monit na obu modelach, model DreamShaper będzie prawdopodobnie bardziej realistyczny, szczegółowy i lepiej oświetlony.
Dotyczy to zwłaszcza portretów lub postaci, czego moim zdaniem brakowało Stable Diffusion w porównaniu z tym samym poleceniem. Jeśli Twoje obrazy staną się zbyt realistyczne, oto cztery sposoby na zidentyfikowanie obrazu wygenerowanego przez AI.
Nie potrzebujesz też gigantycznego komputera, aby uruchomić ten model. Mój GTX 1650Ti z 4 GB pamięci VRAM uruchomił model idealnie. Czas generacji był nieco dłuższy, ale nie wydawało się, aby miało to wpływ na rzeczywisty wynik. Powiedziawszy to, możesz potrzebować GPU z większą ilością pamięci VRAM, aby uruchomić DreamShaper XL, który jest oparty na modelu Stable Diffusion XL.
4Wywołaj AI
Invoke AI to kolejny model generowania obrazów oparty na AI, oparty na Stable Diffusion, z wersją XL opartą na Stable Diffusion XL. Ma również własny interfejs użytkownika sieci Web i wiersza poleceń, co oznacza, że nie będziesz musiał przeskakiwać przez przeszkody z rzeczami takimi jak interfejs użytkownika sieci Web Stable Diffusion.

Model ten koncentruje się na umożliwieniu użytkownikom tworzenia wizualizacji na podstawie ich własności intelektualnej z dostosowanymi przepływami pracy. InvokeAI jest jednym z najlepszych modeli generowania obrazów AI typu open source do trenowania niestandardowych modeli i pracy z własnością intelektualną.
W oficjalnym repozytorium Github wymieniono dwie metody instalacji: instalację za pomocą instalatora InvokeAI lub za pomocą PyPI, jeśli dobrze radzisz sobie z terminalem i Pythonem oraz potrzebujesz większej kontroli nad pakietami instalowanymi za pomocą modelu.
Jednak dodatkowa kontrola wiąże się z kilkoma ograniczeniami, przede wszystkim bardziej rygorystycznymi wymaganiami sprzętowymi. InvokeAI zaleca dedykowany procesor graficzny z co najmniej 4 GB pamięci, przy czym zaleca się od sześciu do ośmiu GB do uruchomienia wariantu XL. Wymagania dotyczące pamięci VRAM dotyczą zarówno procesorów graficznych AMD, jak i Nvidia. Będziesz także potrzebować co najmniej 12 GB pamięci RAM i 12 GB wolnego miejsca na dysku dla modelu, jego zależności i Pythona.

Chociaż dokumentacja nie zaleca procesorów graficznych Nvidia GTX 10 Series i 16 Series ze względu na brak pamięci wideo, dostarczony instalator działał bez zarzutu. Choć Twoje wyniki mogą się różnić, jeśli masz procesor graficzny niższej klasy, spodziewaj się dłuższego oczekiwania na zamianę monitów na obrazy. Na koniec, jeśli używasz systemu Windows, możesz używać tylko procesora graficznego Nvidia, ponieważ obecnie nie ma wsparcia dla procesorów graficznych AMD.
W części dotyczącej generowania obrazu model ma tendencję do skłaniania się bardziej ku stylom artystycznym niż fotorealizmowi. Oczywiście możesz trenować model na swoim zestawie danych i sprawić, by generował obrazy bliższe temu, czego chcesz, nawet jeśli obejmuje to obrazy fotorealistyczne, zwłaszcza jeśli pracujesz w projektowaniu produktów, architekturze lub przestrzeniach handlowych. Jednak jedną ważną rzeczą, o której należy pamiętać, jest to, że InvokeAI jest przede wszystkim silnikiem generowania obrazu, co oznacza, że prawdopodobnie będziesz musiał użyć własnych modeli, aby uzyskać najlepsze wyniki (łatwo je znaleźć za pomocą menedżera modeli dostępnego w interfejsie internetowym), ponieważ domyślny model jest dość podobny do samego Stable Diffusion.
5Otwarta podróż
Openjourney to darmowy, open-source’owy model generowania obrazów AI oparty ponownie na Stable Diffusion. Jeśli zastanawiasz się, dlaczego model nazywa się Openjourney, to dlatego, że został wytrenowany na obrazach Midjourney i może naśladować jego styl w generowanych obrazach.
PromptHero, firma stojąca za Openjourney, pozwala przetestować model wraz z innymi modelami, w tym Stable Diffusion (wersje 1.5 i 2), DreamShaper i Realistic Vision. Po zarejestrowaniu otrzymujesz 25 darmowych kredytów (jeden kredyt za każdy wygenerowany obraz), po czym musisz wykupić subskrypcję Pro, która kosztuje 9 USD miesięcznie i daje dostęp do 300 kredytów miesięcznie z innymi ekskluzywnymi funkcjami.

Jeśli jednak chcesz uruchomić go lokalnie i za darmo, możesz pobrać plik modelu z HuggingFace i uruchomić go za pomocą interfejsu internetowego Stable Diffusion. Openjourney jest również drugim najczęściej pobieranym modelem generowania obrazów AI na HuggingFace, zaraz za Stable Diffusion.
Openjourney nie wymienia żadnych konkretnych wymagań sprzętowych do lokalnego uruchomienia modelu na swojej stronie internetowej, ale możesz spodziewać się podobnych wymagań sprzętowych do Stable Diffusion. Oznacza to dedykowany procesor graficzny z 4 GB pamięci VRAM, 16 GB pamięci RAM i około 12 do 15 GB wolnego miejsca na komputerze, aby zapisać model i jego zależności.

Obrazy generowane przez Openjourney są zazwyczaj zrównoważone między fotorealizmem a sztuką, chyba że określono inaczej. Jeśli szukasz wszechstronnego modelu i wolisz wygląd i styl Midjourney bez płacenia za subskrypcję, Openjourney jest jedną z najlepszych opcji.
Wesprzyj naszą pracę ❤️
Jeśli spodobał Ci się ten artykuł, rozważ pozostawienie napiwku, aby pomóc nam dalej publikować wartościowe treści.




















