OpenSearch jako baza wiedzy dla AI: wyszukiwanie wektorowe, RAG i agenci
Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla zespołów budujących rozwiązania AI: embeddingi i k-NN, indeks wektorowy, wyszukiwanie hybrydowe i reranking, przygotowanie bazy wiedzy, potok RAG z cytowaniami i uprawnieniami, ocena jakości oraz agenci AI i MCP.
Zbudujesz w OpenSearch warstwę wyszukiwania dla asystenta AI: od embeddingów i indeksu wektorowego, przez wyszukiwanie hybrydowe z rerankingiem, po potok RAG z cytowaniami, uprawnieniami i pomiarem jakości odpowiedzi.
- Czas trwania szkolenia:
- 16 godzin · 16 godz. (2 dni)
- Poziom zaawansowania:
- Średniozaawansowany
- Grupa docelowa:
- Programiści, inżynierowie danych i ML, architekci, zespoły wdrażające AI
Dostępne terminy szkolenia
Najbliższy termin otwarty ogłoszę po zebraniu grupy 4 osób - zostaw zapytanie z preferowanym miesiącem albo zapisz się na powiadomienie o kolejnych terminach. Szkolenie zamknięte dla Twojej firmy mogę poprowadzić w dowolnym uzgodnionym terminie.
Forma szkolenia
Interesuje Cię szkolenie stacjonarne?
Powiadom o kolejnych terminach
Interesuje Cię szkolenie w innym terminie?
Po szkoleniu uczestnik potrafi
- ✓Zrozumiesz, za co w rozwiązaniu RAG odpowiada OpenSearch, a za co model językowy
- ✓Dobierzesz model embeddingów i strategię dzielenia dokumentów na fragmenty
- ✓Przygotujesz indeks wektorowy: mapowanie, parametry k-NN, filtry, koszt pamięci
- ✓Zintegrujesz modele przez ML Commons - w chmurze i we własnej infrastrukturze
- ✓Połączysz wyszukiwanie tekstowe i wektorowe oraz dodasz reranking
- ✓Zbudujesz potok RAG z cytowaniem źródeł i respektowaniem uprawnień użytkownika
- ✓Zmierzysz jakość wyszukiwania i odpowiedzi na własnym zestawie pytań
- ✓Zaplanujesz aktualizację bazy wiedzy bez przebudowy całego indeksu
- ✓Udostępnisz wyszukiwanie agentowi AI przez MCP i ograniczysz zakres jego działań
Wymagania
- Doświadczenie w programowaniu w dowolnym języku
- Podstawy HTTP i JSON
- Podstawowa znajomość OpenSearch lub Elasticsearch mile widziana, nie wymagana
- Znajomość uczenia maszynowego nie jest wymagana
Grupa docelowa
- Zespoły budujące asystenta odpowiadającego na pytania o własne dokumenty
- Programiści, którzy mają działający prototyp RAG i chcą go doprowadzić do produkcji
- Inżynierowie danych przygotowujący bazę wiedzy dla modeli językowych
- Zespoły, które mają już OpenSearch na logi i chcą wykorzystać go także do AI
Plan szkolenia
Po co RAG i gdzie w nim OpenSearch
- Skąd biorą się błędne odpowiedzi modeli i co naprawia RAG
- Architektura rozwiązania: źródła → indeks → wyszukiwanie → model → odpowiedź
- Rola OpenSearch: wyszukiwanie, filtrowanie, uprawnienia, skala
- Kiedy RAG, kiedy dostrojenie modelu, a kiedy zwykła wyszukiwarka
- Typowe błędy w prototypach RAG i ich konsekwencje
Podstawy wyszukiwania wektorowego
- Wyszukiwanie według znaczenia a wyszukiwanie słów
- Czym są embeddingi i jak porównuje się podobieństwo
- Wyszukiwanie najbliższych sąsiadów (k-NN): dokładne i przybliżone
- Jak działa HNSW i co oznaczają jego parametry
- Kompromisy: jakość wyników, szybkość, zużycie pamięci
Przygotowanie bazy wiedzy
- Źródła: dokumenty, strony, zgłoszenia, dokumentacja techniczna
- Wyciąganie tekstu i czyszczenie treści
- Dzielenie dokumentów na fragmenty - strategie i wpływ na wyniki
- Metadane fragmentu: źródło, sekcja, data, właściciel, poziom dostępu
- Deduplikacja i wersje dokumentów
- Aktualizacja bazy wiedzy bez przebudowy całości
Modele i integracja
- Dobór modelu tworzącego embeddingi (język, długość kontekstu, koszt)
- Integracja modeli przez ML Commons i konektory
- Modele działające we własnej infrastrukturze
- Tworzenie embeddingów przy zapisie dokumentu (ingest pipeline)
- Limity, koszty i ponawianie przy masowym indeksowaniu
- Zmiana modelu embeddingów - co wtedy z istniejącym indeksem
Indeks wektorowy w OpenSearch
- Mapowanie pola wektorowego i wybór silnika
- Parametry indeksu a jakość i pamięć
- Łączenie wektorów z polami zwykłymi w jednym dokumencie
- Filtrowanie wyników wektorowych (data, kategoria, uprawnienia)
- Aktualizacja i usuwanie dokumentów wraz z embeddingami
- Wielkość indeksu, shardy i wymagania sprzętowe
Wyszukiwanie hybrydowe i trafność
- Kiedy lepsze jest wyszukiwanie tekstowe, a kiedy wektorowe
- Wyszukiwanie hybrydowe i normalizacja ocen z różnych metod
- Reranking, czyli ponowne porządkowanie wyników
- Ile fragmentów zwracać i jak je łączyć w kontekst
- Porównywanie jakości wyników na przykładowych pytaniach
Budowa potoku RAG
- Od pytania użytkownika do zapytania do OpenSearch
- Wyszukiwanie fragmentów potrzebnych do udzielenia odpowiedzi
- Przekazywanie znalezionych informacji do modelu językowego
- Wskazywanie źródeł wykorzystanych w odpowiedzi
- Uwzględnianie uprawnień użytkownika podczas pobierania dokumentów
- Co zrobić, gdy w bazie nie ma odpowiedzi
- Buforowanie, opóźnienia i koszty zapytań
Ocena jakości i utrzymanie
- Zestaw pytań kontrolnych jako podstawa pracy nad jakością
- Miary jakości wyszukiwania i ocena poprawności odpowiedzi
- Wykrywanie regresji po zmianie modelu, chunkingu lub zapytania
- Obserwowanie systemu na produkcji: pytania bez odpowiedzi, opinie użytkowników
- Bezpieczeństwo danych i treści wrażliwych w bazie wiedzy
Agenci AI i wykorzystanie MCP
- Agent AI a prosty mechanizm pytań i odpowiedzi
- Jak agent korzysta z narzędzi do wyszukiwania i analizy danych
- Do czego służy protokół MCP
- Udostępnienie wyszukiwania w OpenSearch jako narzędzia dla agenta
- Podłączanie dodatkowych narzędzi i źródeł informacji
- Ograniczanie uprawnień i zakresu działań agenta
- Przykład asystenta wspierającego analizę zdarzeń
Scenariusze zaawansowane i GraphRAG
- Wyszukiwanie podobnych incydentów i sposobów ich rozwiązania
- Łączenie danych analitycznych z dokumentacją i bazą wiedzy
- Czym jest GraphRAG i kiedy relacje między informacjami pomagają
- Co jest potrzebne do zbudowania GraphRAG
- Omówienie architektur dopasowanych do danych i potrzeb zespołu
Warsztat: asystent na własnych dokumentach
- Od zbioru dokumentów do działającego wyszukiwania hybrydowego
- Odpowiedź z cytowaniem źródeł
- Pomiar jakości i lista kolejnych kroków
Podsumowanie i zakończenie
- Powtórka najważniejszych zagadnień
- Pytania i odpowiedzi
- Materiały i dalsza ścieżka nauki
Formy szkolenia
Online na żywo z trenerem
Zdalnie, w małej grupie, z własną maszyną wirtualną dla każdego uczestnika. Cały czas widzisz mój pulpit i możesz zadawać pytania.
Stacjonarnie u klienta
Przyjeżdżam do Twojej firmy w dowolnym miejscu w Polsce. Laboratorium stawiamy na Waszej infrastrukturze albo na przygotowanych przeze mnie maszynach.
Dedykowane dla firm
Program dopasowuję do Waszego stosu i problemów: wersja Elasticsearch, wolumen danych, integracje. Ćwiczymy na scenariuszach zbliżonych do Waszej produkcji.
Marcin Lewandowski
Praktyk, nie tylko trener. Programista i architekt systemów z ponad 10-letnim doświadczeniem. Elasticsearch utrzymuję i rozwijam na produkcji, a nie tylko na slajdach - wiem, co się psuje o trzeciej w nocy i jak tego uniknąć.
Autor kursów Elasticsearch i RabbitMQ na czterytygodnie.pl - 86 lekcji wideo o Elasticsearch, z których korzystają setki programistów. Szkolenia na żywo prowadzę od lat dla firm i dla dostawców szkoleń.
Uczę tak, jak sam chciałbym być uczony: mało teorii, dużo laboratorium, każde polecenie wykonujemy razem i rozumiemy, dlaczego działa.
Najczęściej zadawane pytania
Ile osób może wziąć udział w szkoleniu?
Czy potrzebuję własnego środowiska?
Czy szkolenie może być dopasowane do naszego projektu?
Czy uczestnicy dostają materiały?
Jak wygląda rozliczenie?
Szkolenia powiązane
OpenSearch w praktyce: dane, SIEM i wyszukiwanie wektorowe
Trzydniowe szkolenie prowadzone na żywo (online lub stacjonarnie): OpenSearch od podstaw, zbieranie logów przez Vector, analiza bezpieczeństwa z regułami Sigma, utrzymanie klastra i migracja z Elasticsearch 8.x oraz wyszukiwanie wektorowe, RAG i agenci AI.
Więcej…OpenSearch dla programistów: wyszukiwanie, agregacje i integracja z aplikacją
Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla programistów: mapowanie i analiza tekstu, Query DSL i trafność wyników, agregacje, relacje, paginacja dużych zbiorów, integracja z aplikacją oraz wyszukiwanie wektorowe i hybrydowe.
Więcej…OpenSearch dla DevOps: wdrożenie, potok logów i utrzymanie klastra
Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla administratorów i DevOps: instalacja i konfiguracja OpenSearch, bezpieczeństwo, potok logów w Vector, retencja danych, wydajność, monitoring i alerty, kopie zapasowe, cross-cluster search i migracja z Elasticsearch 8.x.
Więcej…Praktyczne wprowadzenie do Elastic Stack (Elasticsearch, Kibana, Logstash, Beats)
Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do administratorów systemów, którzy chcą postawić i utrzymać produkcyjny stos ELK: klaster Elasticsearch, Logstash, Kibana, Filebeat, kopie zapasowe, bezpieczeństwo i monitoring.
Więcej…Elasticsearch dla deweloperów
Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do programistów, którzy chcą budować wyszukiwanie pełnotekstowe i analitykę w oparciu o Elasticsearch: mapowanie, analizery, Query DSL, agregacje, integracja z aplikacją.
Więcej…Elasticsearch i Kibana dla analityków danych
Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do analityków danych i biznesowych, którzy chcą samodzielnie eksplorować dane w Kibanie: Discover, KQL, Lens, dashboardy, ES|QL, alerty i raporty - bez programowania.
Więcej…RabbitMQ: kolejki, klaster i bezpieczeństwo w praktyce
Szkolenie prowadzone na żywo (online lub stacjonarnie) dla programistów i administratorów, którzy chcą świadomie używać RabbitMQ: model AMQP, exchange'e, kolejki i ich parametry, potwierdzenia, klaster wysokiej dostępności, monitoring i bezpieczeństwo.
Więcej…Kibana: wizualizacja danych, dashboardy i alerty
Jednodniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla osób pracujących z Kibaną: eksploracja danych w Discover i KQL, wizualizacje w Lens, interaktywne dashboardy, ES|QL, alerty i raporty oraz porządek w Kibanie (Spaces, role).
Więcej…Logstash: przetwarzanie logów i danych w pipeline'ach
Jednodniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla administratorów i inżynierów danych: architektura Logstash, inputy, filtry grok/dissect/mutate/date/geoip, outputy do Elasticsearch, wiele pipeline'ów, kolejki persistent i DLQ oraz wydajność.
Więcej…