Ana içeriğe geç

Alarm

Genel Bakış

Kubernetes İzleme

Pod ve node sağlık durumlarını izleyin

Elasticsearch İzleme

Cluster sağlığı ve kaynak kullanımını takip edin

Kaynak İzleme

CPU ve disk kullanım oranlarını izleyin

Sertifika Yönetimi

SSL ve JWK sertifika sürelerini takip edin

Log İzleme

Uygulama log sayılarını izleyin

Otomatik Bildirimler

Eşik değerleri aşıldığında anında bildirim alın

Alarm Nedir?

Temel Kavram

Alarm, sisteminizdeki belirli koşulları sürekli olarak kontrol eden ve bu koşullar sağlandığında bildirim gönderen bir izleme sistemidir.

Ne Zaman Kullanılır?
Sistem Sağlığı İzleme

Pod, Node ve Elasticsearch sağlık durumlarını izleme

Kaynak Kullanımı İzleme

CPU ve disk kullanım oranlarını takip etme

Sertifika Yönetimi

SSL ve JWK sertifika sürelerini takip etme

Log Yönetimi

Uygulama log sayılarını izleme

Proaktif Uyarı

Sorunlar oluşmadan önce uyarı alma

Otomatik Bildirim

Kritik durumlarda otomatik bildirim alma

Nasıl Çalışır?
Yapılandırma

Tetiklenme tipi, eşik değeri, zamanlama ve bildirimler belirlenir

Zamanlama

Belirlenen zamanlarda (örn: her saat başı) otomatik olarak kontrol yapılır

Kontrol

Tetiklenme tipine göre belirli bir metrik veya durum kontrol edilir

Eşik Kontrolü

Eşik değeri varsa, kontrol edilen değer eşik değerini aştı mı kontrol edilir

Bildirim

Eşik aşıldığında veya durum değiştiğinde, yapılandırılmış bildirimler tetiklenir

Kayıt

Tüm kontroller geçmişe kaydedilir

Hızlı Başlangıç

İlk Alarmanızı Oluşturma

Menüden Erişim

Ana MenüdenİzlemeAlarm seçeneğine tıklayın

Yeni Alarm Oluştur

"Yeni Oluştur" butonuna tıklayın

Temel Bilgileri Doldurun
  • Ad: Alarma bir isim (örn: "Elasticsearch CPU İzleme")
  • Açıklama: İsteğe bağlı açıklama
Tetiklenme Tipi Seçin

Tetiklenme tipini seçin (örn: Elasticsearch CPU Yüzdesi)

Eşik Değeri Girin

Eşik değerini girin (örn: 80)

Zamanlama Ayarlayın

Kontrol sıklığını belirleyin (örn: Her saat başı)

Kaydet

"Kaydet" butonuna tıklayın

Yeni Alarm Oluşturma

Adım 1: Temel Bilgiler

Ad - Zorunlu

Alarm için benzersiz bir isim girin. Bu isim:

  • Proje içinde benzersiz olmalıdır
  • Boşlukla başlayamaz
  • Sistem otomatik olarak ismin kullanılabilirliğini kontrol eder

İyi İsim Örnekleri:

  • Elasticsearch CPU İzleme
  • Kubernetes Pod Sağlık Durumu
  • SSL Sertifika Süresi Takibi
  • Uygulama Log Sayısı İzleme
Açıklama - Opsiyonel

Alarm hakkında açıklayıcı bilgi girebilirsiniz:

  • Maksimum 1000 karakter
  • Alarmın amacını ve kapsamını açıklamak için kullanılır
  • Liste sayfasında görüntülenir

Örnek Açıklamalar:

  • Elasticsearch cluster'ının CPU kullanımını izlemek için oluşturulmuştur
  • Kubernetes pod'larının sağlık durumunu takip etmek için kullanılır
  • SSL sertifikalarının süre dolmadan önce uyarı vermesi için yapılandırılmıştır
Durum (Status) - Varsayılan: Aktif

Alarmın aktif/pasif durumunu belirler:

  • Aktif: Alarm çalışır, zamanlanmış kontroller yapılır
  • Pasif: Alarm durdurulur, kontrol yapılmaz (geçmiş veriler korunur)

Adım 2: Tetiklenme Tipi ve Eşik Değeri

Tetiklenme Tipleri

Alarmın ne zaman tetikleneceğini belirler. Tetiklenme tipi seçici aranabilir ve tipleri üç kategoriye göre gruplar; her tip listede bir kategori rozeti ile gösterilir:

  • Infrastructure (Altyapı): Kubernetes pod/node sağlığı, K8S Node CPU, Elasticsearch sağlık/CPU/disk, Gateway Thread Sayısı, Gateway Heap Kullanım Yüzdesi, Gateway Deadlock Sayısı, Gateway Executor Havuzu Doluluk Yüzdesi, Gateway Bağlantı Havuzu Kullanım Yüzdesi, Gateway GC Süresi Yüzdesi
  • Platform: API Traffic (logların veritabanında olması), SSL/JWK kalan süre, uygulama log sayısı
  • AI: AI Gateway metrikleri (token kullanımı, günlük maliyet, guardrail/PII sayısı, provider failover, kota, katalog drift, shadow AI)
Infrastructure (Altyapı)
  • Pod / Node Sağlık Durumu
  • K8S Node CPU Yüzdesi
  • Elasticsearch Sağlık / CPU / Disk Yüzdesi
  • Gateway Thread Sayısı
  • Gateway Heap Kullanım Yüzdesi
  • Gateway Deadlock Sayısı
  • Gateway Executor Havuzu Doluluk Yüzdesi
  • Gateway Bağlantı Havuzu Kullanım Yüzdesi
  • Gateway GC Süresi Yüzdesi
Platform
  • API Traffic (Logların Veritabanında Olması)
  • SSL / JWK Sertifika Kalan Süre
  • Uygulama Log Sayısı
AI
  • AI Token Kullanım Yüzdesi / Günlük Maliyet
  • Guardrail / PII Tespit Sayısı
  • Provider Failover, Kota, Katalog Drift, Shadow AI
Kubernetes Tetiklenme Tipleri

Pod Sağlık Durumu: Kubernetes pod'larının sağlık durumunu kontrol eder. Herhangi bir pod sağlıksız olduğunda alarm tetiklenir. Eşik değeri gerektirmez.

Yalnızca Apinizer bileşenlerine ait pod'lar değerlendirilir; aynı namespace'i paylaşan diğer uygulamaların pod'ları ile işini tamamlamış (Succeeded) pod'lar kapsam dışında bırakılır. Pod'un hazır olup olmadığı, Kubernetes'in pod düzeyindeki Ready durumundan okunur; böylece pod'a sonradan eklenen APM/servis ağı yan konteynerleri sonucu değiştirmez.

Node Sağlık Durumu: Kubernetes node'larının sağlık durumunu kontrol eder. Herhangi bir node sağlıksız olduğunda alarm tetiklenir. Eşik değeri gerektirmez.

K8S Node CPU Yüzdesi: Kubernetes node'larının CPU kullanım yüzdesini kontrol eder. CPU kullanım yüzdesi eşik değerini aştığında alarm tetiklenir. Eşik değeri gerektirir (örn: 80 = %80).

Gateway Tetiklenme Tipleri

Aşağıdaki altı Gateway tanılama tetikleyicisi ortak bir mekanizma paylaşır: ortam üzerinde tanımlı Gateway Management API adres(ler)i (Ortam > Management API ayarları) üzerinden her API Gateway worker pod'u ayrı ayrı okunur ve değerlendirilir; herhangi bir pod'un (ya da havuzun) değeri eşiği aştığında alarm tetiklenir (katı karşılaştırma: tam eşik değerindeki satır Uyarı olarak gösterilir, alarm tetiklenmez). Bağlantı tanımı gerektirmezler; ancak ortamda en az bir Gateway Management API adresi tanımlı olmalıdır. İsteğe bağlı Ortam seçicisi kontrolü tek bir ortamla sınırlar; boş bırakıldığında yayındaki tüm ortamlar kontrol edilir. Okunamayan bir pod ya da adres değer olmadan Uyarı olarak listelenir ve tek başına alarmı tetiklemez; hiçbir pod okunamadığında (örneğin tüm adresler erişilemez olduğunda, ortamda management adresi tanımlı olmadığında ya da seçili ortam silindiğinde) koşu Hata Oluştu olarak kaydedilir ve değerlendirme 70 saniye içinde zaman aşımına uğrar.

Satır ayrıntısı, sağlıklı bir pod'un çökmüş sanılmaması için iki farklı Uyarı nedenini birbirinden ayırır: "unreachable: ..." adresin kendisine ulaşılamadığı (ağ hatası, HTTP hatası ya da zaman aşımı) anlamına gelir; "responded, but ..." ise pod normal cevap verdi ama bu tetikleyicinin ihtiyaç duyduğu belirli değer cevapta yoktu (örneğin daha yeni bir tanılama alanından önceki eski bir worker sürümü) anlamına gelir — bu durumda pod'un kendisi ayaktadır.

Gateway Thread Sayısı (Gateway Thread Count): Her pod'un anlık JVM thread sayısını okur. Eşik değeri gerektirir (örn: 2000 = 2000 thread). Alarm geçmişinde her pod ortamı, IP'si ve ölçülen thread sayısıyla listelenir. E-posta ve webhook şablonlarında eşik <n> threads biçiminde yazılır.

Gateway Heap Kullanım Yüzdesi (Gateway Heap Usage Percentage): Her pod'un JVM heap kullanımını kullanılan / maksimum × 100 olarak hesaplar. JVM'i heap üst sınırı bildirmeyen (-1) bir pod, değer olmadan Uyarı olarak listelenir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.

Gateway Deadlock Sayısı (Gateway Deadlock Count): Her pod'daki deadlock'a girmiş thread sayısını okur. Yeni bir alarmda bu tip seçildiğinde eşik otomatik olarak 0 gelir (elle girilen ya da kayıtlı bir eşik değiştirilmez) — bu tetikleyicide %10'luk bir uyarı bandı yoktur, 0 değeri Normal, 1 ve üzeri doğrudan alarmı tetikler.

Gateway Executor Havuzu Doluluk Yüzdesi (Gateway Executor Pool Saturation Percentage): Her pod'daki her executor havuzu için aktif / kapasite × 100 hesaplanır; satır adı "pod / havuz adı" biçimindedir, bir pod'da birden fazla havuz varsa birden fazla satır oluşur. Kapasite, havuzun maksimum boyutu ya da sınırsız (scheduled/cached) havuzlarda çekirdek boyutudur. Satır ayrıntısında kuyruk uzunluğu ve reddedilen görev sayısı da gösterilir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.

Gateway Bağlantı Havuzu Kullanım Yüzdesi (Gateway Connection Pool Usage Percentage): Her pod'daki her bağlantı havuzu için leased / maxTotal × 100 hesaplanır; satır adı "pod / havuz" biçimindedir. Bekleyen (pending) istek sayısı sıfırdan büyükse satır ayrıntısında gösterilir ve satırı eşiğin altında olsa bile Uyarı durumuna yükseltir. maxTotal tanımlamayan bir havuz değer olmadan Uyarı olarak listelenir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.

Gateway GC Süresi Yüzdesi (Gateway GC Time Percentage): Her pod için toplam GC süresi / JVM çalışma süresi × 100 hesaplanır — her iki değer de JVM başlangıcından beri kümülatiftir (son aralığın payı değil, ömür boyu pay). Eşik değeri yüzde (%) cinsindendir; önerilen eşik %5.

Elasticsearch Tetiklenme Tipleri

Elasticsearch Sağlık Durumu: Elasticsearch cluster'ının sağlık durumunu kontrol eder. Cluster sağlıksız olduğunda alarm tetiklenir. Değerlendirme satırının adı, sabit bir metin değil kümenin yanıtta bildirdiği gerçek adıdır (cluster_name). Eşik değeri gerektirmez. Bağlantı tanımı gerektirir.

Elasticsearch CPU Yüzdesi: Elasticsearch cluster'ındaki her node ayrı ayrı kontrol edilir; her node için "Elasticsearch düğümü" etiketiyle bir satır oluşur (düğüm adı + ölçülen yüzde + durum rozeti). Herhangi bir node'un CPU kullanım yüzdesi eşik değerini aştığında alarm tetiklenir; ihlal açıklamasında eşiği aşan düğümlerin adları ve "toplam kaç düğümden kaçının aştığı" bilgisi birlikte yer alır. Eşik değeri gerektirir (örn: 80 = %80). Bağlantı tanımı gerektirir.

Elasticsearch Disk Yüzdesi: Elasticsearch cluster'ındaki her node ayrı ayrı kontrol edilir; her node "Elasticsearch düğümü" etiketiyle listelenir. Herhangi bir node'un disk kullanım yüzdesi eşik değerini aştığında alarm tetiklenir; ihlal açıklamasında eşiği aşan düğümlerin adları ve "toplam kaç düğümden kaçının aştığı" bilgisi birlikte yer alır. Disk istatistiği bildirmeyen node'lar (yalnız koordinasyon yapan node'lar) değerlendirmeye alınmaz. Eşik değeri gerektirir (örn: 90 = %90). Bağlantı tanımı gerektirir.

Elasticsearch Loglarının Veritabanında Olması: Elasticsearch loglarının veritabanında olup olmadığını kontrol eder. Loglar veritabanında olduğunda alarm tetiklenir. Eşik değeri gerektirmez.

not

Elasticsearch'e ulaşılamadığında — bağlantı tanımsız ya da pasif, kümeye erişilemedi ya da küme hiçbir düğüm istatistiği döndürmedi — alarm sonucu Hata Oluştu olarak kaydedilir ve özet "KONTROL EDİLEMEDİ" der; bu üç durum birbirinden ayrı, açık nedenlerle gösterilir. Özet artık bu durumlarda yanlışlıkla "kontrol edildi" demez.

Sertifika Tetiklenme Tipleri

SSL Sertifika Kalan Süre: SSL sertifikalarının kalan süresini kontrol eder. Kalan süre eşik değerinden az olduğunda alarm tetiklenir. Eşik değeri gerektirir (örn: 30 = 30 gün).

JWK Sertifika Kalan Süre: JWK sertifikalarının kalan süresini kontrol eder. Kalan süre eşik değerinden az olduğunda alarm tetiklenir. Eşik değeri gerektirir (örn: 30 = 30 gün).

Uygulama Log Tetiklenme Tipleri

Uygulama Log Sayısı: Belirli bir uygulama log tipinin sayısını kontrol eder. Log sayısı eşik değerini aştığında alarm tetiklenir. Eşik değeri gerektirir (örn: 10000 = 10.000 kayıt). Log tipi seçilmelidir.

Desteklenen Log Tipleri:

  • Manager Logs
  • Gateway Logs
  • Cache Logs
  • Integration Logs
  • Portal Logs
  • Audit Logs Manager
  • Audit Logs ACL
  • Ve daha fazlası...
AI Tetiklenme Tipleri

AI kategorisindeki tetiklenme tipleri AI Gateway trafiğini ve varlık kataloğunu izler. Bağlantı tanımı gerektirmezler; kapsam (proje / ortam / sağlayıcı gibi) alarm formunda ayrıca seçilir.

  • AI Token Kullanım Yüzdesi: Tanımlı token kotasının yüzde kaçının kullanıldığını kontrol eder. Eşik değeri gerektirir (örn: 80 = %80).
  • AI Günlük Maliyet Eşiği (USD): Günlük AI kullanım maliyetinin belirlenen tutarı aşıp aşmadığını kontrol eder. Eşik değeri gerektirir (USD cinsinden).
  • AI Guardrail Engelleme Sayısı: Guardrail kurallarınca engellenen istek sayısını kontrol eder. Eşik değeri gerektirir.
  • AI PII Tespit Sayısı: Kişisel veri (PII) tespiti yapılan istek sayısını kontrol eder. Eşik değeri gerektirir.
  • AI Sağlayıcı Failover Sayısı: Bir AI sağlayıcısından yedeğe geçiş (failover) sayısını kontrol eder. Eşik değeri gerektirir.
  • AI Kota Yumuşak Üst Sınır Aşım Sayısı: Yumuşak kota sınırının aşıldığı durum sayısını kontrol eder. Eşik değeri gerektirir.
  • AI Kota Yalnız-Uyarı Sayısı: İstek engellenmeden yalnızca uyarı üreten kota aşımı sayısını kontrol eder. Eşik değeri gerektirir.
  • AI MCP Katalog Sapması: Kayıtlı MCP araç kataloğunda beklenmeyen bir değişiklik (sapma) olup olmadığını kontrol eder. Eşik değeri gerektirir.
  • AI A2A Katalog Sapması: Kayıtlı A2A (agent-to-agent) kataloğunda beklenmeyen bir değişiklik olup olmadığını kontrol eder. Eşik değeri gerektirir.
  • AI Gölge Varlık Sayısı: Kataloğa kayıtlı olmayan, beklenmedik (gölge) AI varlığı sayısını kontrol eder. Eşik değeri gerektirir.

Eşik Değeri (Threshold)

Eşik değeri, alarmın ne zaman tetikleneceğini belirler. Tetiklenme tipine göre farklı birimler kullanılır:

Tetiklenme TipiBirimÖrnek DeğerAçıklama
K8S Node CPU Yüzdesi%80CPU kullanımı %80'i aştığında
Gateway Thread SayısıThread2000Herhangi bir gateway worker pod'unun anlık thread sayısı 2000'i aştığında
Gateway Heap Kullanım Yüzdesi%85Herhangi bir pod'un heap kullanımı %85'i aştığında
Gateway Deadlock SayısıDeadlock0Herhangi bir pod'da en az bir deadlock'a girmiş thread olduğunda
Gateway Executor Havuzu Doluluk Yüzdesi%85Herhangi bir pod/havuzda active/capacity oranı %85'i aştığında
Gateway Bağlantı Havuzu Kullanım Yüzdesi%85Herhangi bir pod/havuzda leased/maxTotal oranı %85'i aştığında
Gateway GC Süresi Yüzdesi%5Herhangi bir pod'un JVM başlangıcından beri kümülatif GC süresi payı %5'i aştığında
Elasticsearch CPU Yüzdesi%80CPU kullanımı %80'i aştığında
Elasticsearch Disk Yüzdesi%90Disk kullanımı %90'ı aştığında
SSL Sertifika Kalan SüreGün30Kalan süre 30 günden az olduğunda
JWK Sertifika Kalan SüreGün30Kalan süre 30 günden az olduğunda
Uygulama Log SayısıKayıt10000Log sayısı 10.000'i aştığında
ipucu

Eşik Değeri Önerileri:

  • CPU İzleme: %70-80 arası
  • Disk İzleme: %80-90 arası
  • Sertifika Takibi: 30-60 gün arası
  • Log Sayısı: Sistem kapasitesine göre

Bağlantı Tanımı (Connection)

Bazı tetiklenme tipleri için Elasticsearch bağlantısı gereklidir:

Bağlantı Gerektiren Tetiklenme Tipleri:

  • Elasticsearch Sağlık Durumu
  • Elasticsearch CPU Yüzdesi
  • Elasticsearch Disk Yüzdesi

Bağlantı Gerektirmeyen Tetiklenme Tipleri:

  • Kubernetes tetiklenme tipleri
  • Gateway Thread Sayısı, Gateway Heap Kullanım Yüzdesi, Gateway Deadlock Sayısı, Gateway Executor Havuzu Doluluk Yüzdesi, Gateway Bağlantı Havuzu Kullanım Yüzdesi, Gateway GC Süresi Yüzdesi (bağlantı yerine ortamda Gateway Management API adresi gerektirir)
  • Sertifika tetiklenme tipleri
  • Uygulama log tetiklenme tipleri
  • AI tetiklenme tipleri
not

Elasticsearch bağlantısı, Bağlantı Yönetimi sayfasında oluşturulmuş bağlantılardan seçilir. Bağlantı aktif ve erişilebilir olmalıdır.

Adım 3: Zamanlama Ayarları

Alarmın ne sıklıkla kontrol edileceğini belirleyin. Cron Expression kullanarak zamanlama yapılır.

Yaygın Zamanlama Örnekleri

AçıklamaCron ExpressionKullanım Senaryosu
Her saat başı0 0 * ? * *Genel izleme için (en yaygın)
Her 30 dakikada bir0 */30 * ? * *Kritik sistemler için
Her 15 dakikada bir0 */15 * ? * *Çok kritik sistemler için
Her gün saat 09:000 0 9 * ? *Günlük raporlama için
Her 5 dakikada bir0 */5 * ? * *Çok sık kontrol gereken durumlar için
ipucu

Öneriler:

  • Genel İzleme için: Her saat başı
  • Kritik Sistemler için: Her 15-30 dakikada bir
  • Sertifika Takibi için: Her gün saat 09:00
  • Kaynak İzleme için: Her 30 dakikada bir

Adım 4: Bildirim Alıcıları (Recipients)

Alarm tetiklendiğinde bildirim gönderecek alıcıları yapılandırın:

Bildirim Ekleme
Eylemler Tablosuna Ekle

Eylemler tablosunda "Ekle" butonuna tıklayın

Bildirim Türünü Seçin

Desteklenen bildirim türleri:

  • Email: Email bildirimi gönderir
  • Webhook: HTTP POST isteği gönderir
  • Slack: Slack kanalına mesaj gönderir
  • SMS: SMS bildirimi gönderir
  • Sistem Bildirimi: Sistem içi bildirim gönderir
  • Ve daha fazlası...
Bildirim Yapılandırmasını Tamamlayın

Bildirim türüne göre gerekli bilgileri doldurun

not

Eylemler hakkında detaylı bilgi için Konnektörler sayfasına bakınız.

Bildirim Yönetimi

Bildirim Tablosu Sütunları:

  • Ad: Bildirim adı
  • Tip: Bildirim tipi (Email, Webhook, Slack vb.)
  • Durum: Aktif/Pasif durumu
  • Açıklama: Bildirim açıklaması

Bildirim İşlemleri:

  • Düzenle: Bildirim bilgilerini güncellemek için menüden "Düzenle" seçin
  • Sil: Bildirimi kaldırmak için menüden "Sil" seçin
  • Aktif/Pasif: Toggle ile bildirimi aktif/pasif yapabilirsiniz

Adım 5: Kaydetme

Tüm bilgileri doldurduktan sonra:

  1. Form validasyonlarının geçtiğinden emin olun:

    • ✅ Ad girilmiş ve kullanılabilir
    • ✅ Tetiklenme tipi seçilmiş
    • ✅ Eşik değeri girilmiş (gerekirse)
    • ✅ Bağlantı tanımı seçilmiş (gerekirse)
    • ✅ Zamanlama ayarları yapılmış
  2. "Kaydet" butonuna tıklayın

  3. Alarm kaydedildikten sonra otomatik olarak listeleme sayfasına yönlendirilirsiniz

Görüntüleme (View) ve Sonuçlar

Alarm adına tıkladığınızda veya işlemler menüsünden (⋮) "Görüntüle" seçtiğinizde, alarma ait tek sayfalık Görüntüleme (View) ekranı açılır. Bu ekran hem son değerlendirme sonuçlarını hem de yapılandırmayı tek yerde gösterir; ayrı bir geçmiş sayfası yoktur.

Üst Bilgi ve Metrik Kartları

Üst barda Yenile, Etkinleştir/Devre Dışı Bırak, Geri ve Düzenle butonları bulunur. Altında 5 özet metrik kartı yer alır:

  • Current value (Güncel değer): Son değerlendirmedeki değer (durum rengine göre renklendirilir)
  • Threshold (Eşik): Alarmın eşik değeri
  • Last fired (Son tetiklenme): En son eşik aşımının zamanı
  • Fires (24h): Son 24 saatteki tetiklenme sayısı
  • Actions: Bağlı bildirim kanalı sayısı

Sekmeler

Matched records (Eşleşen kayıtlar)

Son çalışmada değerlendirilen tüm nesneler (her Elasticsearch node, sertifika, pod…), en kritik üstte. Her satır nesne adı, değeri ve durum rozetini gösterir:

  • 🔴 BREACHED: Eşik aşıldı
  • 🟠 WARNING: Eşiğe yakın
  • 🟢 NORMAL: Normal aralıkta

Üstte "n / m breached" rozeti, "Only breached" filtresi ve sayfalama bulunur.

Trigger history (Tetiklenme geçmişi)

Her değerlendirmenin sonucu — sayfalı tablo:

  • Evaluated at: Değerlendirme tarih/saati
  • Value: Ölçülen değer. Gateway Deadlock Sayısı için değer deadlock birim eki ile gösterilir; diğer tetikleyici tiplerinde değer çıplak (birimsiz) gösterilir.
  • Result: 🟢 Eşik Aşılmadı · 🔴 Eşik Aşıldı · 🟠 Hata Oluştu
  • Summary: Kontrol özeti
  • Detail: varsa özetin altında gösterilir — daha uzun açıklama (örn. hangi pod/adresin okunamadığı ya da kaç nesnenin eşiği aştığı)

Elasticsearch tetikleyicilerinin özet ve açıklama metinleri artık arayüz dilinde gösterilir. Bu değişiklikten önce oluşmuş geçmiş kayıtları ham İngilizce metinle görünmeye devam eder; bu beklenen bir davranıştır.

Configuration (Yapılandırma)

Alarmın salt-okunur tanımı:

  • Alert definition: Ad, açıklama ve Durum (Status): Etkin / Pasif rozeti
  • Trigger: Tetiklenme tipi + kategori rozeti, eşik, bağlantı, log tipi, AI kapsamı
  • Schedule: Cron ifadesi
  • Actions: Bildirim kanalları (tip, ad, durum)

Canlı Kontrol (Live Check) Paneli

Görüntüleme ekranının sağ kolonundaki Live check paneli, alarmın koşulunu şimdi — kaydetmeden çalıştırıp alarmın tetiklenip tetiklenmeyeceğini gösterir:

  • Evaluate now: Koşulu anlık değerlendirir. Bu değerlendirme geçmişe (Trigger history) bir kayıt yazar ve liste görünümündeki güncel değeri günceller; bildirim/recipient TETİKLEMEZ. Butonun altında son değerlendirme saati görünür.
  • Worst object: Şu an en kötü durumdaki nesnenin değeri ve eşik işaretli bar.
  • Objects evaluated: Değerlendirilen nesneler ve "n / m breached" rozeti.
  • Last 12 evaluations (Son 12 değerlendirme): Sayısal değer üreten tetikleyicilerde (örn. Elasticsearch CPU/Disk Yüzdesi) son değerlendirmelerin çizgi grafiği + kırmızı kesikli eşik çizgisi gösterilir. Sayısal değer üretmeyen durum kontrollerinde (örn. Elasticsearch/Pod/Node Sağlık Durumu) ve hatayla sonuçlanan koşularda, grafik yerine koşu başına renkli bir durum çubuğu gösterilir (yeşil: eşik aşılmadı, kırmızı: eşik aşıldı, turuncu: hata oluştu); çubuğun üzerine gelindiğinde tarih ve sonuç görünür.
  • Sonuç kutusu: "Condition met — the alert would fire" (kırmızı), "Condition not met" (yeşil) veya değerlendirme hatası (amber).
not

Sayfa açıldığında koşul otomatik olarak salt-okunur biçimde değerlendirilir (geçmişe yazmaz); yalnızca Evaluate now butonu geçmişe kayıt yazar.

Alarm Yönetimi

Alarm listesi — durum ve kaynak filtreleri, Current value sütunu

Liste Sayfası Özellikleri

Alarm listesi sayfasında tüm alarmlarınızı görüntüleyebilir ve yönetebilirsiniz.

Arama ve Filtreleme
  • Ad arama: Alarm adında geçen ifadeye göre arama yapabilirsiniz (içerir araması)
  • Açıklama arama: Alarm açıklamasında geçen ifadeye göre ayrıca arama yapabilirsiniz (içerir araması)
  • Proje Filtresi: Alarmları projeye göre filtreleyebilirsiniz (admin listesi tüm projeleri kapsar)
  • Durum segmenti: All / Firing (Tetiklenen) / Normal / Disabled (Pasif)
  • Kaynak segmenti: All sources / Infrastructure (Altyapı) / Platform / AI — tetiklenme tipi kategorisinden beslenir
Tablo Sütunları
  • Alert: Durum noktası + alarm adı (tıklanabilir, Görüntüleme sayfasına gider) + açıklama + ihlal özeti ("N records breached · closest …")
  • Trigger type: Tetiklenme tipi + kategori rozeti (Infrastructure/Platform/AI)
  • Condition: Koşul (örn. ≥ 85 %, is not healthy, stops arriving)
  • Current value: Son değerlendirmedeki değer (renkli) + eşik referansı + bar
  • Every: Kontrol sıklığı (örn. 5m, 24h)
  • Project: Alarmın projesi
  • Actions: Bildirim kanalı çipleri
  • : İşlemler menüsü
İşlemler Menüsü

Her alarm için menü butonuna (⋮) tıklayarak şu işlemleri yapabilirsiniz:

  1. Görüntüle (View): Alarmın Görüntüleme sayfasını (metrikler + Live check + geçmiş) aç
  2. Düzenle (Edit): Alarm ayarlarını güncelle
  3. Etkinleştir / Devre Dışı Bırak (Activate/Deactivate): Alarmı aktif/pasif yap
  4. Çoğalt (Duplicate): Alarmın kopyasını oluştur
  5. Sil (Delete): Alarmı sil
Durum Değiştirme (Activate/Deactivate)

Alarmın etkin/pasif durumunu değiştirmek için işlemler menüsünden (⋮) Etkinleştir veya Devre Dışı Bırak'ı seçin. Aynı işlem Görüntüleme ekranının üst barından da yapılabilir. Yalnızca enabled bayrağı değişir; bildirim alıcıları ve zamanlama korunur. Pasif alarmlar çalışmaz, ancak geçmiş verileri korunur.

En İyi Uygulamalar

İsimlendirme Kuralları
  • Açıklayıcı isimler kullanın: Elasticsearch CPU İzleme
  • Ortam/Proje öneki ekleyin: Production - SSL Sertifika Takibi
  • Tetiklenme tipi belirtin: K8S Node CPU İzleme
Eşik Değeri Stratejisi
  • CPU İzleme: %70-80 arası
  • Disk İzleme: %80-90 arası
  • Sertifika Takibi: 30-60 gün arası
  • Log Sayısı: Sistem kapasitesine göre
Zamanlama Stratejisi
  • Kritik Sistemler: Her 15-30 dakikada bir
  • Genel İzleme: Her saat başı
  • Sertifika Takibi: Her gün saat 09:00
  • Kaynak İzleme: Her 30 dakikada bir
Bildirim Yönetimi
  • Kritik Alarmlar: Email + SMS bildirimi
  • Genel Alarmlar: Email bildirimi yeterli
  • Webhook: Entegrasyon sistemlerinize bildirim gönderin
  • Bildirim Spam: Uygun zamanlama ile bildirim spam'inden kaçının

Sık Sorulan Sorular

Alarm Ne Sıklıkla Çalışır?

Alarmın çalışma sıklığı, oluştururken belirlediğiniz Zamanlama (Cron Expression) ayarlarına bağlıdır. Örneğin:

  • 0 0 * ? * * → Her saat başı
  • 0 */30 * ? * * → Her 30 dakikada bir
  • 0 0 9 * ? * → Her gün saat 09:00
Alarm Pasif Yapıldığında Ne Olur?

Alarm pasif yapıldığında:

  • Yeni kontroller yapılmaz
  • Mevcut zamanlanmış işler iptal edilir
  • Geçmiş kayıtlar korunur ve görüntülenebilir
  • Alarm tekrar aktif yapıldığında normal çalışmaya devam eder
Eşik Değeri Nasıl Belirlenir?

Eşik değeri, sisteminizin normal çalışma koşullarına göre belirlenmelidir:

  • CPU İzleme: Normal CPU kullanımının %20-30 üzeri
  • Disk İzleme: Disk kapasitesinin %80-90'ı
  • Sertifika Takibi: Sertifika yenileme süresinden önce (örn: 30 gün)
  • Log Sayısı: Sistem kapasitesine göre
Birden Fazla Bildirim Ekleyebilir miyim?

Evet, birden fazla bildirim ekleyebilirsiniz. Her bildirim:

  • Farklı bir tip olabilir (Email, SMS, Webhook vb.)
  • Farklı alıcılara gönderilebilir
  • Bağımsız olarak aktif/pasif yapılabilir
Geçmiş Kayıtları Ne Kadar Süre Saklanır?

Geçmiş kayıtları, manuel olarak silinene kadar saklanır. Eski kayıtları temizlemek için:

  • Geçmiş sayfasında "Tümünü Sil" butonunu kullanabilirsiniz
  • Veya kayıtları düzenli olarak temizleyebilirsiniz
Alarm Silindiğinde Ne Olur?

Alarm silindiğinde:

  • Alarm tanımı veritabanından silinir
  • Tüm geçmiş kayıtları silinir
  • Zamanlanmış işler iptal edilir
  • Geçmiş veriler kalıcı olarak kaybolur
uyarı

Uyarı: Silme işlemi geri alınamaz!

Sorun Giderme

Alarm Çalışmıyor

Olası Nedenler:

  1. Alarm pasif durumda olabilir → işlemler menüsünden Etkinleştir'i seçin (durumu Görüntüleme ekranındaki Configuration sekmesinden doğrulayın)
  2. Zamanlama ayarları yanlış olabilir → Cron expression'ı kontrol edin
  3. Elasticsearch bağlantısı yok veya erişilemiyor → Bağlantı ayarlarını kontrol edin
  4. Eşik değeri yanlış yapılandırılmış olabilir → Eşik değerini kontrol edin

Çözüm:

  • Alarm durumunu aktif yapın
  • Zamanlama ayarlarını kontrol edin
  • Elasticsearch bağlantısını kontrol edin
  • Eşik değerini kontrol edin
Tüm Sonuçlar 'Hata Oluştu' Durumunda

Olası Nedenler:

  1. Elasticsearch bağlantısı yok veya erişilemiyor
  2. Kubernetes cluster'ına erişilemiyor
  3. Sistem kaynakları yetersiz
  4. Yapılandırma hatası

Çözüm:

  • Elasticsearch bağlantısını kontrol edin
  • Kubernetes cluster bağlantısını kontrol edin
  • Sistem kaynaklarını kontrol edin
  • Alarm yapılandırmasını kontrol edin
Aynı Alarm Geçmişte Aynı Saatle İki Kez Görünüyor

Olası Neden:

  • API Manager birden fazla kopya (replica) ile çalışıyor ve aynı kontrol iki kopyada aynı anda çalışmış

Çözüm:

  • API Manager'ı güncel sürüme yükseltin: eş zamanlı çalışan kopyalarda her kontrol artık yalnızca bir kopyada çalışır
  • Bir sonraki kontrol aralığından sonra alarm geçmişini tekrar inceleyerek tek satır oluştuğunu doğrulayın
  • Tekrar eden kayıtlar sürüyorsa alarmı silip yeniden oluşturun
Çok Fazla Bildirim Geliyor

Olası Nedenler:

  1. Eşik değeri çok düşük
  2. Zamanlama çok sık
  3. Birden fazla bildirim aktif

Çözüm:

  • Eşik değerini artırın
  • Zamanlama sıklığını azaltın
  • Gereksiz bildirimleri pasif yapın
Bildirimler Gelmiyor

Olası Nedenler:

  1. Bildirim pasif durumda
  2. Bildirim yapılandırması hatalı
  3. Email/SMS servisi çalışmıyor

Çözüm:

  • Bildirim durumunu aktif yapın
  • Bildirim yapılandırmasını kontrol edin
  • Email/SMS servis ayarlarını kontrol edin

Ek Kaynaklar