OpenSearch jako baza wiedzy dla AI: wyszukiwanie wektorowe, RAG i agenci

Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla zespołów budujących rozwiązania AI: embeddingi i k-NN, indeks wektorowy, wyszukiwanie hybrydowe i reranking, przygotowanie bazy wiedzy, potok RAG z cytowaniami i uprawnieniami, ocena jakości oraz agenci AI i MCP.

Zbudujesz w OpenSearch warstwę wyszukiwania dla asystenta AI: od embeddingów i indeksu wektorowego, przez wyszukiwanie hybrydowe z rerankingiem, po potok RAG z cytowaniami, uprawnieniami i pomiarem jakości odpowiedzi.

Czas trwania szkolenia:
16 godzin · 16 godz. (2 dni)
Poziom zaawansowania:
Średniozaawansowany
Grupa docelowa:
Programiści, inżynierowie danych i ML, architekci, zespoły wdrażające AI
Kalendarz

Dostępne terminy szkolenia

Ładuję terminy…

Forma szkolenia

Interesuje Cię szkolenie stacjonarne?

Powiadom o kolejnych terminach

Interesuje Cię szkolenie w innym terminie?

Efekty szkolenia

Po szkoleniu uczestnik potrafi

  • ✓Zrozumiesz, za co w rozwiązaniu RAG odpowiada OpenSearch, a za co model językowy
  • ✓Dobierzesz model embeddingów i strategię dzielenia dokumentów na fragmenty
  • ✓Przygotujesz indeks wektorowy: mapowanie, parametry k-NN, filtry, koszt pamięci
  • ✓Zintegrujesz modele przez ML Commons - w chmurze i we własnej infrastrukturze
  • ✓Połączysz wyszukiwanie tekstowe i wektorowe oraz dodasz reranking
  • ✓Zbudujesz potok RAG z cytowaniem źródeł i respektowaniem uprawnień użytkownika
  • ✓Zmierzysz jakość wyszukiwania i odpowiedzi na własnym zestawie pytań
  • ✓Zaplanujesz aktualizację bazy wiedzy bez przebudowy całego indeksu
  • ✓Udostępnisz wyszukiwanie agentowi AI przez MCP i ograniczysz zakres jego działań
Przed startem

Wymagania

  • Doświadczenie w programowaniu w dowolnym języku
  • Podstawy HTTP i JSON
  • Podstawowa znajomość OpenSearch lub Elasticsearch mile widziana, nie wymagana
  • Znajomość uczenia maszynowego nie jest wymagana

Grupa docelowa

  • Zespoły budujące asystenta odpowiadającego na pytania o własne dokumenty
  • Programiści, którzy mają działający prototyp RAG i chcą go doprowadzić do produkcji
  • Inżynierowie danych przygotowujący bazę wiedzy dla modeli językowych
  • Zespoły, które mają już OpenSearch na logi i chcą wykorzystać go także do AI
Zakres kursu

Plan szkolenia

Po co RAG i gdzie w nim OpenSearch

  • Skąd biorą się błędne odpowiedzi modeli i co naprawia RAG
  • Architektura rozwiązania: źródła → indeks → wyszukiwanie → model → odpowiedź
  • Rola OpenSearch: wyszukiwanie, filtrowanie, uprawnienia, skala
  • Kiedy RAG, kiedy dostrojenie modelu, a kiedy zwykła wyszukiwarka
  • Typowe błędy w prototypach RAG i ich konsekwencje

Podstawy wyszukiwania wektorowego

  • Wyszukiwanie według znaczenia a wyszukiwanie słów
  • Czym są embeddingi i jak porównuje się podobieństwo
  • Wyszukiwanie najbliższych sąsiadów (k-NN): dokładne i przybliżone
  • Jak działa HNSW i co oznaczają jego parametry
  • Kompromisy: jakość wyników, szybkość, zużycie pamięci

Przygotowanie bazy wiedzy

  • Źródła: dokumenty, strony, zgłoszenia, dokumentacja techniczna
  • Wyciąganie tekstu i czyszczenie treści
  • Dzielenie dokumentów na fragmenty - strategie i wpływ na wyniki
  • Metadane fragmentu: źródło, sekcja, data, właściciel, poziom dostępu
  • Deduplikacja i wersje dokumentów
  • Aktualizacja bazy wiedzy bez przebudowy całości

Modele i integracja

  • Dobór modelu tworzącego embeddingi (język, długość kontekstu, koszt)
  • Integracja modeli przez ML Commons i konektory
  • Modele działające we własnej infrastrukturze
  • Tworzenie embeddingów przy zapisie dokumentu (ingest pipeline)
  • Limity, koszty i ponawianie przy masowym indeksowaniu
  • Zmiana modelu embeddingów - co wtedy z istniejącym indeksem

Indeks wektorowy w OpenSearch

  • Mapowanie pola wektorowego i wybór silnika
  • Parametry indeksu a jakość i pamięć
  • Łączenie wektorów z polami zwykłymi w jednym dokumencie
  • Filtrowanie wyników wektorowych (data, kategoria, uprawnienia)
  • Aktualizacja i usuwanie dokumentów wraz z embeddingami
  • Wielkość indeksu, shardy i wymagania sprzętowe

Wyszukiwanie hybrydowe i trafność

  • Kiedy lepsze jest wyszukiwanie tekstowe, a kiedy wektorowe
  • Wyszukiwanie hybrydowe i normalizacja ocen z różnych metod
  • Reranking, czyli ponowne porządkowanie wyników
  • Ile fragmentów zwracać i jak je łączyć w kontekst
  • Porównywanie jakości wyników na przykładowych pytaniach

Budowa potoku RAG

  • Od pytania użytkownika do zapytania do OpenSearch
  • Wyszukiwanie fragmentów potrzebnych do udzielenia odpowiedzi
  • Przekazywanie znalezionych informacji do modelu językowego
  • Wskazywanie źródeł wykorzystanych w odpowiedzi
  • Uwzględnianie uprawnień użytkownika podczas pobierania dokumentów
  • Co zrobić, gdy w bazie nie ma odpowiedzi
  • Buforowanie, opóźnienia i koszty zapytań

Ocena jakości i utrzymanie

  • Zestaw pytań kontrolnych jako podstawa pracy nad jakością
  • Miary jakości wyszukiwania i ocena poprawności odpowiedzi
  • Wykrywanie regresji po zmianie modelu, chunkingu lub zapytania
  • Obserwowanie systemu na produkcji: pytania bez odpowiedzi, opinie użytkowników
  • Bezpieczeństwo danych i treści wrażliwych w bazie wiedzy

Agenci AI i wykorzystanie MCP

  • Agent AI a prosty mechanizm pytań i odpowiedzi
  • Jak agent korzysta z narzędzi do wyszukiwania i analizy danych
  • Do czego służy protokół MCP
  • Udostępnienie wyszukiwania w OpenSearch jako narzędzia dla agenta
  • Podłączanie dodatkowych narzędzi i źródeł informacji
  • Ograniczanie uprawnień i zakresu działań agenta
  • Przykład asystenta wspierającego analizę zdarzeń

Scenariusze zaawansowane i GraphRAG

  • Wyszukiwanie podobnych incydentów i sposobów ich rozwiązania
  • Łączenie danych analitycznych z dokumentacją i bazą wiedzy
  • Czym jest GraphRAG i kiedy relacje między informacjami pomagają
  • Co jest potrzebne do zbudowania GraphRAG
  • Omówienie architektur dopasowanych do danych i potrzeb zespołu

Warsztat: asystent na własnych dokumentach

  • Od zbioru dokumentów do działającego wyszukiwania hybrydowego
  • Odpowiedź z cytowaniem źródeł
  • Pomiar jakości i lista kolejnych kroków

Podsumowanie i zakończenie

  • Powtórka najważniejszych zagadnień
  • Pytania i odpowiedzi
  • Materiały i dalsza ścieżka nauki
Jak pracujemy

Formy szkolenia

Online na żywo z trenerem

Zdalnie, w małej grupie, z własną maszyną wirtualną dla każdego uczestnika. Cały czas widzisz mój pulpit i możesz zadawać pytania.

Stacjonarnie u klienta

Przyjeżdżam do Twojej firmy w dowolnym miejscu w Polsce. Laboratorium stawiamy na Waszej infrastrukturze albo na przygotowanych przeze mnie maszynach.

Dedykowane dla firm

Program dopasowuję do Waszego stosu i problemów: wersja Elasticsearch, wolumen danych, integracje. Ćwiczymy na scenariuszach zbliżonych do Waszej produkcji.

Kto prowadzi

Marcin Lewandowski

Marcin Lewandowski

Praktyk, nie tylko trener. Programista i architekt systemów z ponad 10-letnim doświadczeniem. Elasticsearch utrzymuję i rozwijam na produkcji, a nie tylko na slajdach - wiem, co się psuje o trzeciej w nocy i jak tego uniknąć.

Autor kursów Elasticsearch i RabbitMQ na czterytygodnie.pl - 86 lekcji wideo o Elasticsearch, z których korzystają setki programistów. Szkolenia na żywo prowadzę od lat dla firm i dla dostawców szkoleń.

Uczę tak, jak sam chciałbym być uczony: mało teorii, dużo laboratorium, każde polecenie wykonujemy razem i rozumiemy, dlaczego działa.

FAQ

Najczęściej zadawane pytania

Ile osób może wziąć udział w szkoleniu?
Optymalnie 4-8 osób. Przy takiej grupie każdy zdąży zrobić wszystkie ćwiczenia, a ja mam czas na indywidualne pytania. Większe grupy wyceniam indywidualnie.
Czy potrzebuję własnego środowiska?
Nie. Każdy uczestnik dostaje własną maszynę wirtualną z przygotowanym laboratorium (Elasticsearch, Kibana, Logstash, dane testowe). Wystarczy przeglądarka. Przy szkoleniu stacjonarnym możemy pracować na Waszej infrastrukturze.
Czy szkolenie może być dopasowane do naszego projektu?
Tak i to jest najczęstszy wariant. Przed szkoleniem robimy 30-minutową rozmowę o Waszym stosie i problemach, a program dopasowuję pod nie. Cena nie zmienia się, o ile mieścimy się w 2 dniach.
Czy uczestnicy dostają materiały?
Tak: skrypt szkolenia w PDF, wszystkie polecenia i konfiguracje z laboratorium oraz dostęp do mojego kursu wideo Elasticsearch na 3 miesiące po szkoleniu.
Jak wygląda rozliczenie?
Faktura VAT po szkoleniu, cena za uczestnika. Dla firm zamawiających więcej niż jedno szkolenie lub grupę powyżej 8 osób przygotuję ofertę indywidualną.
Zobacz też

Szkolenia powiązane

OpenSearch w praktyce: dane, SIEM i wyszukiwanie wektorowe

🕒 24 godzin · Podstawowy → zaawansowany

Trzydniowe szkolenie prowadzone na żywo (online lub stacjonarnie): OpenSearch od podstaw, zbieranie logów przez Vector, analiza bezpieczeństwa z regułami Sigma, utrzymanie klastra i migracja z Elasticsearch 8.x oraz wyszukiwanie wektorowe, RAG i agenci AI.

Więcej…

OpenSearch dla programistów: wyszukiwanie, agregacje i integracja z aplikacją

🕒 16 godzin · Podstawowy → średniozaawansowany

Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla programistów: mapowanie i analiza tekstu, Query DSL i trafność wyników, agregacje, relacje, paginacja dużych zbiorów, integracja z aplikacją oraz wyszukiwanie wektorowe i hybrydowe.

Więcej…

OpenSearch dla DevOps: wdrożenie, potok logów i utrzymanie klastra

🕒 16 godzin · Podstawowy → średniozaawansowany

Dwudniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla administratorów i DevOps: instalacja i konfiguracja OpenSearch, bezpieczeństwo, potok logów w Vector, retencja danych, wydajność, monitoring i alerty, kopie zapasowe, cross-cluster search i migracja z Elasticsearch 8.x.

Więcej…

Praktyczne wprowadzenie do Elastic Stack (Elasticsearch, Kibana, Logstash, Beats)

🕒 16 godzin · Podstawowy → średniozaawansowany

Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do administratorów systemów, którzy chcą postawić i utrzymać produkcyjny stos ELK: klaster Elasticsearch, Logstash, Kibana, Filebeat, kopie zapasowe, bezpieczeństwo i monitoring.

Więcej…

Elasticsearch dla deweloperów

🕒 16 godzin · Podstawowy → średniozaawansowany

Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do programistów, którzy chcą budować wyszukiwanie pełnotekstowe i analitykę w oparciu o Elasticsearch: mapowanie, analizery, Query DSL, agregacje, integracja z aplikacją.

Więcej…

Elasticsearch i Kibana dla analityków danych

🕒 16 godzin · Podstawowy

Szkolenie prowadzone na żywo (online lub stacjonarnie) skierowane do analityków danych i biznesowych, którzy chcą samodzielnie eksplorować dane w Kibanie: Discover, KQL, Lens, dashboardy, ES|QL, alerty i raporty - bez programowania.

Więcej…

RabbitMQ: kolejki, klaster i bezpieczeństwo w praktyce

🕒 16 godzin · Podstawowy → średniozaawansowany

Szkolenie prowadzone na żywo (online lub stacjonarnie) dla programistów i administratorów, którzy chcą świadomie używać RabbitMQ: model AMQP, exchange'e, kolejki i ich parametry, potwierdzenia, klaster wysokiej dostępności, monitoring i bezpieczeństwo.

Więcej…

Kibana: wizualizacja danych, dashboardy i alerty

🕒 8 godzin · Podstawowy → średniozaawansowany

Jednodniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla osób pracujących z Kibaną: eksploracja danych w Discover i KQL, wizualizacje w Lens, interaktywne dashboardy, ES|QL, alerty i raporty oraz porządek w Kibanie (Spaces, role).

Więcej…

Logstash: przetwarzanie logów i danych w pipeline'ach

🕒 8 godzin · Podstawowy → średniozaawansowany

Jednodniowe szkolenie prowadzone na żywo (online lub stacjonarnie) dla administratorów i inżynierów danych: architektura Logstash, inputy, filtry grok/dissect/mutate/date/geoip, outputy do Elasticsearch, wiele pipeline'ów, kolejki persistent i DLQ oraz wydajność.

Więcej…