Alarm
Genel Bakış
Pod ve node sağlık durumlarını izleyin
Cluster sağlığı ve kaynak kullanımını takip edin
CPU ve disk kullanım oranlarını izleyin
SSL ve JWK sertifika sürelerini takip edin
Uygulama log sayılarını izleyin
Eşik değerleri aşıldığında anında bildirim alın
Alarm Nedir?
Temel Kavram
Alarm, sisteminizdeki belirli koşulları sürekli olarak kontrol eden ve bu koşullar sağlandığında bildirim gönderen bir izleme sistemidir.
Ne Zaman Kullanılır?
Pod, Node ve Elasticsearch sağlık durumlarını izleme
CPU ve disk kullanım oranlarını takip etme
SSL ve JWK sertifika sürelerini takip etme
Uygulama log sayılarını izleme
Sorunlar oluşmadan önce uyarı alma
Kritik durumlarda otomatik bildirim alma
Nasıl Çalışır?
Tetiklenme tipi, eşik değeri, zamanlama ve bildirimler belirlenir
Belirlenen zamanlarda (örn: her saat başı) otomatik olarak kontrol yapılır
Tetiklenme tipine göre belirli bir metrik veya durum kontrol edilir
Eşik değeri varsa, kontrol edilen değer eşik değerini aştı mı kontrol edilir
Eşik aşıldığında veya durum değiştiğinde, yapılandırılmış bildirimler tetiklenir
Tüm kontroller geçmişe kaydedilir
Hızlı Başlangıç
İlk Alarmanızı Oluşturma
Ana Menüden → İzleme → Alarm seçeneğine tıklayın
"Yeni Oluştur" butonuna tıklayın
- Ad: Alarma bir isim (örn: "Elasticsearch CPU İzleme")
- Açıklama: İsteğe bağlı açıklama
Tetiklenme tipini seçin (örn: Elasticsearch CPU Yüzdesi)
Eşik değerini girin (örn: 80)
Kontrol sıklığını belirleyin (örn: Her saat başı)
"Kaydet" butonuna tıklayın
Yeni Alarm Oluşturma
Adım 1: Temel Bilgiler
Ad - Zorunlu
Alarm için benzersiz bir isim girin. Bu isim:
- Proje içinde benzersiz olmalıdır
- Boşlukla başlayamaz
- Sistem otomatik olarak ismin kullanılabilirliğini kontrol eder
İyi İsim Örnekleri:
Elasticsearch CPU İzlemeKubernetes Pod Sağlık DurumuSSL Sertifika Süresi TakibiUygulama Log Sayısı İzleme
Açıklama - Opsiyonel
Alarm hakkında açıklayıcı bilgi girebilirsiniz:
- Maksimum 1000 karakter
- Alarmın amacını ve kapsamını açıklamak için kullanılır
- Liste sayfasında görüntülenir
Örnek Açıklamalar:
Elasticsearch cluster'ının CPU kullanımını izlemek için oluşturulmuşturKubernetes pod'larının sağlık durumunu takip etmek için kullanılırSSL sertifikalarının süre dolmadan önce uyarı vermesi için yapılandırılmıştır
Durum (Status) - Varsayılan: Aktif
Alarmın aktif/pasif durumunu belirler:
- Aktif: Alarm çalışır, zamanlanmış kontroller yapılır
- Pasif: Alarm durdurulur, kontrol yapılmaz (geçmiş veriler korunur)
Adım 2: Tetiklenme Tipi ve Eşik Değeri
Tetiklenme Tipleri
Alarmın ne zaman tetikleneceğini belirler. Tetiklenme tipi seçici aranabilir ve tipleri üç kategoriye göre gruplar; her tip listede bir kategori rozeti ile gösterilir:
- Infrastructure (Altyapı): Kubernetes pod/node sağlığı, K8S Node CPU, Elasticsearch sağlık/CPU/disk, Gateway Thread Sayısı, Gateway Heap Kullanım Yüzdesi, Gateway Deadlock Sayısı, Gateway Executor Havuzu Doluluk Yüzdesi, Gateway Bağlantı Havuzu Kullanım Yüzdesi, Gateway GC Süresi Yüzdesi
- Platform: API Traffic (logların veritabanında olması), SSL/JWK kalan süre, uygulama log sayısı
- AI: AI Gateway metrikleri (token kullanımı, günlük maliyet, guardrail/PII sayısı, provider failover, kota, katalog drift, shadow AI)
- Pod / Node Sağlık Durumu
- K8S Node CPU Yüzdesi
- Elasticsearch Sağlık / CPU / Disk Yüzdesi
- Gateway Thread Sayısı
- Gateway Heap Kullanım Yüzdesi
- Gateway Deadlock Sayısı
- Gateway Executor Havuzu Doluluk Yüzdesi
- Gateway Bağlantı Havuzu Kullanım Yüzdesi
- Gateway GC Süresi Yüzdesi
- API Traffic (Logların Veritabanında Olması)
- SSL / JWK Sertifika Kalan Süre
- Uygulama Log Sayısı
- AI Token Kullanım Yüzdesi / Günlük Maliyet
- Guardrail / PII Tespit Sayısı
- Provider Failover, Kota, Katalog Drift, Shadow AI
Kubernetes Tetiklenme Tipleri
Pod Sağlık Durumu: Kubernetes pod'larının sağlık durumunu kontrol eder. Herhangi bir pod sağlıksız olduğunda alarm tetiklenir. Eşik değeri gerektirmez.
Yalnızca Apinizer bileşenlerine ait pod'lar değerlendirilir; aynı namespace'i paylaşan diğer uygulamaların pod'ları ile işini tamamlamış (Succeeded) pod'lar kapsam dışında bırakılır. Pod'un hazır olup olmadığı, Kubernetes'in pod düzeyindeki Ready durumundan okunur; böylece pod'a sonradan eklenen APM/servis ağı yan konteynerleri sonucu değiştirmez.
Node Sağlık Durumu: Kubernetes node'larının sağlık durumunu kontrol eder. Herhangi bir node sağlıksız olduğunda alarm tetiklenir. Eşik değeri gerektirmez.
K8S Node CPU Yüzdesi: Kubernetes node'larının CPU kullanım yüzdesini kontrol eder. CPU kullanım yüzdesi eşik değerini aştığında alarm tetiklenir. Eşik değeri gerektirir (örn: 80 = %80).
Gateway Tetiklenme Tipleri
Aşağıdaki altı Gateway tanılama tetikleyicisi ortak bir mekanizma paylaşır: ortam üzerinde tanımlı Gateway Management API adres(ler)i (Ortam > Management API ayarları) üzerinden her API Gateway worker pod'u ayrı ayrı okunur ve değerlendirilir; herhangi bir pod'un (ya da havuzun) değeri eşiği aştığında alarm tetiklenir (katı karşılaştırma: tam eşik değerindeki satır Uyarı olarak gösterilir, alarm tetiklenmez). Bağlantı tanımı gerektirmezler; ancak ortamda en az bir Gateway Management API adresi tanımlı olmalıdır. İsteğe bağlı Ortam seçicisi kontrolü tek bir ortamla sınırlar; boş bırakıldığında yayındaki tüm ortamlar kontrol edilir. Okunamayan bir pod ya da adres değer olmadan Uyarı olarak listelenir ve tek başına alarmı tetiklemez; hiçbir pod okunamadığında (örneğin tüm adresler erişilemez olduğunda, ortamda management adresi tanımlı olmadığında ya da seçili ortam silindiğinde) koşu Hata Oluştu olarak kaydedilir ve değerlendirme 70 saniye içinde zaman aşımına uğrar.
Satır ayrıntısı, sağlıklı bir pod'un çökmüş sanılmaması için iki farklı Uyarı nedenini birbirinden ayırır: "unreachable: ..." adresin kendisine ulaşılamadığı (ağ hatası, HTTP hatası ya da zaman aşımı) anlamına gelir; "responded, but ..." ise pod normal cevap verdi ama bu tetikleyicinin ihtiyaç duyduğu belirli değer cevapta yoktu (örneğin daha yeni bir tanılama alanından önceki eski bir worker sürümü) anlamına gelir — bu durumda pod'un kendisi ayaktadır.
Gateway Thread Sayısı (Gateway Thread Count): Her pod'un anlık JVM thread sayısını okur. Eşik
değeri gerektirir (örn: 2000 = 2000 thread). Alarm geçmişinde her pod ortamı, IP'si ve ölçülen thread
sayısıyla listelenir. E-posta ve webhook şablonlarında eşik <n> threads biçiminde yazılır.
Gateway Heap Kullanım Yüzdesi (Gateway Heap Usage Percentage): Her pod'un JVM heap kullanımını
kullanılan / maksimum × 100 olarak hesaplar. JVM'i heap üst sınırı bildirmeyen (-1) bir pod, değer
olmadan Uyarı olarak listelenir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.
Gateway Deadlock Sayısı (Gateway Deadlock Count): Her pod'daki deadlock'a girmiş thread sayısını okur. Yeni bir alarmda bu tip seçildiğinde eşik otomatik olarak 0 gelir (elle girilen ya da kayıtlı bir eşik değiştirilmez) — bu tetikleyicide %10'luk bir uyarı bandı yoktur, 0 değeri Normal, 1 ve üzeri doğrudan alarmı tetikler.
Gateway Executor Havuzu Doluluk Yüzdesi (Gateway Executor Pool Saturation Percentage): Her pod'daki
her executor havuzu için aktif / kapasite × 100 hesaplanır; satır adı "pod / havuz adı" biçimindedir,
bir pod'da birden fazla havuz varsa birden fazla satır oluşur. Kapasite, havuzun maksimum boyutu ya da
sınırsız (scheduled/cached) havuzlarda çekirdek boyutudur. Satır ayrıntısında kuyruk uzunluğu ve
reddedilen görev sayısı da gösterilir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.
Gateway Bağlantı Havuzu Kullanım Yüzdesi (Gateway Connection Pool Usage Percentage): Her pod'daki
her bağlantı havuzu için leased / maxTotal × 100 hesaplanır; satır adı "pod / havuz" biçimindedir.
Bekleyen (pending) istek sayısı sıfırdan büyükse satır ayrıntısında gösterilir ve satırı eşiğin altında
olsa bile Uyarı durumuna yükseltir. maxTotal tanımlamayan bir havuz değer olmadan Uyarı olarak
listelenir. Eşik değeri yüzde (%) cinsindendir; önerilen eşik %85.
Gateway GC Süresi Yüzdesi (Gateway GC Time Percentage): Her pod için toplam GC süresi / JVM çalışma süresi × 100 hesaplanır — her iki değer de JVM başlangıcından beri kümülatiftir (son
aralığın payı değil, ömür boyu pay). Eşik değeri yüzde (%) cinsindendir; önerilen eşik %5.
Elasticsearch Tetiklenme Tipleri
Elasticsearch Sağlık Durumu: Elasticsearch cluster'ının sağlık durumunu kontrol eder. Cluster sağlıksız olduğunda alarm tetiklenir. Değerlendirme satırının adı, sabit bir metin değil kümenin yanıtta bildirdiği gerçek adıdır (cluster_name). Eşik değeri gerektirmez. Bağlantı tanımı gerektirir.
Elasticsearch CPU Yüzdesi: Elasticsearch cluster'ındaki her node ayrı ayrı kontrol edilir; her node için "Elasticsearch düğümü" etiketiyle bir satır oluşur (düğüm adı + ölçülen yüzde + durum rozeti). Herhangi bir node'un CPU kullanım yüzdesi eşik değerini aştığında alarm tetiklenir; ihlal açıklamasında eşiği aşan düğümlerin adları ve "toplam kaç düğümden kaçının aştığı" bilgisi birlikte yer alır. Eşik değeri gerektirir (örn: 80 = %80). Bağlantı tanımı gerektirir.
Elasticsearch Disk Yüzdesi: Elasticsearch cluster'ındaki her node ayrı ayrı kontrol edilir; her node "Elasticsearch düğümü" etiketiyle listelenir. Herhangi bir node'un disk kullanım yüzdesi eşik değerini aştığında alarm tetiklenir; ihlal açıklamasında eşiği aşan düğümlerin adları ve "toplam kaç düğümden kaçının aştığı" bilgisi birlikte yer alır. Disk istatistiği bildirmeyen node'lar (yalnız koordinasyon yapan node'lar) değerlendirmeye alınmaz. Eşik değeri gerektirir (örn: 90 = %90). Bağlantı tanımı gerektirir.
Elasticsearch Loglarının Veritabanında Olması: Elasticsearch loglarının veritabanında olup olmadığını kontrol eder. Loglar veritabanında olduğunda alarm tetiklenir. Eşik değeri gerektirmez.
Elasticsearch'e ulaşılamadığında — bağlantı tanımsız ya da pasif, kümeye erişilemedi ya da küme hiçbir düğüm istatistiği döndürmedi — alarm sonucu Hata Oluştu olarak kaydedilir ve özet "KONTROL EDİLEMEDİ" der; bu üç durum birbirinden ayrı, açık nedenlerle gösterilir. Özet artık bu durumlarda yanlışlıkla "kontrol edildi" demez.
Sertifika Tetiklenme Tipleri
SSL Sertifika Kalan Süre: SSL sertifikalarının kalan süresini kontrol eder. Kalan süre eşik değerinden az olduğunda alarm tetiklenir. Eşik değeri gerektirir (örn: 30 = 30 gün).
JWK Sertifika Kalan Süre: JWK sertifikalarının kalan süresini kontrol eder. Kalan süre eşik değerinden az olduğunda alarm tetiklenir. Eşik değeri gerektirir (örn: 30 = 30 gün).
Uygulama Log Tetiklenme Tipleri
Uygulama Log Sayısı: Belirli bir uygulama log tipinin sayısını kontrol eder. Log sayısı eşik değerini aştığında alarm tetiklenir. Eşik değeri gerektirir (örn: 10000 = 10.000 kayıt). Log tipi seçilmelidir.
Desteklenen Log Tipleri:
- Manager Logs
- Gateway Logs
- Cache Logs
- Integration Logs
- Portal Logs
- Audit Logs Manager
- Audit Logs ACL
- Ve daha fazlası...
AI Tetiklenme Tipleri
AI kategorisindeki tetiklenme tipleri AI Gateway trafiğini ve varlık kataloğunu izler. Bağlantı tanımı gerektirmezler; kapsam (proje / ortam / sağlayıcı gibi) alarm formunda ayrıca seçilir.
- AI Token Kullanım Yüzdesi: Tanımlı token kotasının yüzde kaçının kullanıldığını kontrol eder. Eşik değeri gerektirir (örn: 80 = %80).
- AI Günlük Maliyet Eşiği (USD): Günlük AI kullanım maliyetinin belirlenen tutarı aşıp aşmadığını kontrol eder. Eşik değeri gerektirir (USD cinsinden).
- AI Guardrail Engelleme Sayısı: Guardrail kurallarınca engellenen istek sayısını kontrol eder. Eşik değeri gerektirir.
- AI PII Tespit Sayısı: Kişisel veri (PII) tespiti yapılan istek sayısını kontrol eder. Eşik değeri gerektirir.
- AI Sağlayıcı Failover Sayısı: Bir AI sağlayıcısından yedeğe geçiş (failover) sayısını kontrol eder. Eşik değeri gerektirir.
- AI Kota Yumuşak Üst Sınır Aşım Sayısı: Yumuşak kota sınırının aşıldığı durum sayısını kontrol eder. Eşik değeri gerektirir.
- AI Kota Yalnız-Uyarı Sayısı: İstek engellenmeden yalnızca uyarı üreten kota aşımı sayısını kontrol eder. Eşik değeri gerektirir.
- AI MCP Katalog Sapması: Kayıtlı MCP araç kataloğunda beklenmeyen bir değişiklik (sapma) olup olmadığını kontrol eder. Eşik değeri gerektirir.
- AI A2A Katalog Sapması: Kayıtlı A2A (agent-to-agent) kataloğunda beklenmeyen bir değişiklik olup olmadığını kontrol eder. Eşik değeri gerektirir.
- AI Gölge Varlık Sayısı: Kataloğa kayıtlı olmayan, beklenmedik (gölge) AI varlığı sayısını kontrol eder. Eşik değeri gerektirir.
Eşik Değeri (Threshold)
Eşik değeri, alarmın ne zaman tetikleneceğini belirler. Tetiklenme tipine göre farklı birimler kullanılır:
| Tetiklenme Tipi | Birim | Örnek Değer | Açıklama |
|---|---|---|---|
| K8S Node CPU Yüzdesi | % | 80 | CPU kullanımı %80'i aştığında |
| Gateway Thread Sayısı | Thread | 2000 | Herhangi bir gateway worker pod'unun anlık thread sayısı 2000'i aştığında |
| Gateway Heap Kullanım Yüzdesi | % | 85 | Herhangi bir pod'un heap kullanımı %85'i aştığında |
| Gateway Deadlock Sayısı | Deadlock | 0 | Herhangi bir pod'da en az bir deadlock'a girmiş thread olduğunda |
| Gateway Executor Havuzu Doluluk Yüzdesi | % | 85 | Herhangi bir pod/havuzda active/capacity oranı %85'i aştığında |
| Gateway Bağlantı Havuzu Kullanım Yüzdesi | % | 85 | Herhangi bir pod/havuzda leased/maxTotal oranı %85'i aştığında |
| Gateway GC Süresi Yüzdesi | % | 5 | Herhangi bir pod'un JVM başlangıcından beri kümülatif GC süresi payı %5'i aştığında |
| Elasticsearch CPU Yüzdesi | % | 80 | CPU kullanımı %80'i aştığında |
| Elasticsearch Disk Yüzdesi | % | 90 | Disk kullanımı %90'ı aştığında |
| SSL Sertifika Kalan Süre | Gün | 30 | Kalan süre 30 günden az olduğunda |
| JWK Sertifika Kalan Süre | Gün | 30 | Kalan süre 30 günden az olduğunda |
| Uygulama Log Sayısı | Kayıt | 10000 | Log sayısı 10.000'i aştığında |
Eşik Değeri Önerileri:
- CPU İzleme: %70-80 arası
- Disk İzleme: %80-90 arası
- Sertifika Takibi: 30-60 gün arası
- Log Sayısı: Sistem kapasitesine göre
Bağlantı Tanımı (Connection)
Bazı tetiklenme tipleri için Elasticsearch bağlantısı gereklidir:
Bağlantı Gerektiren Tetiklenme Tipleri:
- Elasticsearch Sağlık Durumu
- Elasticsearch CPU Yüzdesi
- Elasticsearch Disk Yüzdesi
Bağlantı Gerektirmeyen Tetiklenme Tipleri:
- Kubernetes tetiklenme tipleri
- Gateway Thread Sayısı, Gateway Heap Kullanım Yüzdesi, Gateway Deadlock Sayısı, Gateway Executor Havuzu Doluluk Yüzdesi, Gateway Bağlantı Havuzu Kullanım Yüzdesi, Gateway GC Süresi Yüzdesi (bağlantı yerine ortamda Gateway Management API adresi gerektirir)
- Sertifika tetiklenme tipleri
- Uygulama log tetiklenme tipleri
- AI tetiklenme tipleri
Elasticsearch bağlantısı, Bağlantı Yönetimi sayfasında oluşturulmuş bağlantılardan seçilir. Bağlantı aktif ve erişilebilir olmalıdır.
Adım 3: Zamanlama Ayarları
Alarmın ne sıklıkla kontrol edileceğini belirleyin. Cron Expression kullanarak zamanlama yapılır.
Yaygın Zamanlama Örnekleri
| Açıklama | Cron Expression | Kullanım Senaryosu |
|---|---|---|
| Her saat başı | 0 0 * ? * * | Genel izleme için (en yaygın) |
| Her 30 dakikada bir | 0 */30 * ? * * | Kritik sistemler için |
| Her 15 dakikada bir | 0 */15 * ? * * | Çok kritik sistemler için |
| Her gün saat 09:00 | 0 0 9 * ? * | Günlük raporlama için |
| Her 5 dakikada bir | 0 */5 * ? * * | Çok sık kontrol gereken durumlar için |
Öneriler:
- Genel İzleme için: Her saat başı
- Kritik Sistemler için: Her 15-30 dakikada bir
- Sertifika Takibi için: Her gün saat 09:00
- Kaynak İzleme için: Her 30 dakikada bir
Adım 4: Bildirim Alıcıları (Recipients)
Alarm tetiklendiğinde bildirim gönderecek alıcıları yapılandırın:
Bildirim Ekleme
Eylemler tablosunda "Ekle" butonuna tıklayın
Desteklenen bildirim türleri:
- Email: Email bildirimi gönderir
- Webhook: HTTP POST isteği gönderir
- Slack: Slack kanalına mesaj gönderir
- SMS: SMS bildirimi gönderir
- Sistem Bildirimi: Sistem içi bildirim gönderir
- Ve daha fazlası...
Bildirim türüne göre gerekli bilgileri doldurun
Eylemler hakkında detaylı bilgi için Konnektörler sayfasına bakınız.
Bildirim Yönetimi
Bildirim Tablosu Sütunları:
- Ad: Bildirim adı
- Tip: Bildirim tipi (Email, Webhook, Slack vb.)
- Durum: Aktif/Pasif durumu
- Açıklama: Bildirim açıklaması
Bildirim İşlemleri:
- Düzenle: Bildirim bilgilerini güncellemek için menüden "Düzenle" seçin
- Sil: Bildirimi kaldırmak için menüden "Sil" seçin
- Aktif/Pasif: Toggle ile bildirimi aktif/pasif yapabilirsiniz
Adım 5: Kaydetme
Tüm bilgileri doldurduktan sonra:
-
Form validasyonlarının geçtiğinden emin olun:
- ✅ Ad girilmiş ve kullanılabilir
- ✅ Tetiklenme tipi seçilmiş
- ✅ Eşik değeri girilmiş (gerekirse)
- ✅ Bağlantı tanımı seçilmiş (gerekirse)
- ✅ Zamanlama ayarları yapılmış
-
"Kaydet" butonuna tıklayın
-
Alarm kaydedildikten sonra otomatik olarak listeleme sayfasına yönlendirilirsiniz
Görüntüleme (View) ve Sonuçlar
Alarm adına tıkladığınızda veya işlemler menüsünden (⋮) "Görüntüle" seçtiğinizde, alarma ait tek sayfalık Görüntüleme (View) ekranı açılır. Bu ekran hem son değerlendirme sonuçlarını hem de yapılandırmayı tek yerde gösterir; ayrı bir geçmiş sayfası yoktur.
Üst Bilgi ve Metrik Kartları
Üst barda Yenile, Etkinleştir/Devre Dışı Bırak, Geri ve Düzenle butonları bulunur. Altında 5 özet metrik kartı yer alır:
- Current value (Güncel değer): Son değerlendirmedeki değer (durum rengine göre renklendirilir)
- Threshold (Eşik): Alarmın eşik değeri
- Last fired (Son tetiklenme): En son eşik aşımının zamanı
- Fires (24h): Son 24 saatteki tetiklenme sayısı
- Actions: Bağlı bildirim kanalı sayısı
Sekmeler
Matched records (Eşleşen kayıtlar)
Son çalışmada değerlendirilen tüm nesneler (her Elasticsearch node, sertifika, pod…), en kritik üstte. Her satır nesne adı, değeri ve durum rozetini gösterir:
- 🔴 BREACHED: Eşik aşıldı
- 🟠 WARNING: Eşiğe yakın
- 🟢 NORMAL: Normal aralıkta
Üstte "n / m breached" rozeti, "Only breached" filtresi ve sayfalama bulunur.
Trigger history (Tetiklenme geçmişi)
Her değerlendirmenin sonucu — sayfalı tablo:
- Evaluated at: Değerlendirme tarih/saati
- Value: Ölçülen değer. Gateway Deadlock Sayısı için değer
deadlockbirim eki ile gösterilir; diğer tetikleyici tiplerinde değer çıplak (birimsiz) gösterilir. - Result: 🟢 Eşik Aşılmadı · 🔴 Eşik Aşıldı · 🟠 Hata Oluştu
- Summary: Kontrol özeti
- Detail: varsa özetin altında gösterilir — daha uzun açıklama (örn. hangi pod/adresin okunamadığı ya da kaç nesnenin eşiği aştığı)
Elasticsearch tetikleyicilerinin özet ve açıklama metinleri artık arayüz dilinde gösterilir. Bu değişiklikten önce oluşmuş geçmiş kayıtları ham İngilizce metinle görünmeye devam eder; bu beklenen bir davranıştır.
Configuration (Yapılandırma)
Alarmın salt-okunur tanımı:
- Alert definition: Ad, açıklama ve Durum (Status): Etkin / Pasif rozeti
- Trigger: Tetiklenme tipi + kategori rozeti, eşik, bağlantı, log tipi, AI kapsamı
- Schedule: Cron ifadesi
- Actions: Bildirim kanalları (tip, ad, durum)
Canlı Kontrol (Live Check) Paneli
Görüntüleme ekranının sağ kolonundaki Live check paneli, alarmın koşulunu şimdi — kaydetmeden çalıştırıp alarmın tetiklenip tetiklenmeyeceğini gösterir:
- Evaluate now: Koşulu anlık değerlendirir. Bu değerlendirme geçmişe (Trigger history) bir kayıt yazar ve liste görünümündeki güncel değeri günceller; bildirim/recipient TETİKLEMEZ. Butonun altında son değerlendirme saati görünür.
- Worst object: Şu an en kötü durumdaki nesnenin değeri ve eşik işaretli bar.
- Objects evaluated: Değerlendirilen nesneler ve "n / m breached" rozeti.
- Last 12 evaluations (Son 12 değerlendirme): Sayısal değer üreten tetikleyicilerde (örn. Elasticsearch CPU/Disk Yüzdesi) son değerlendirmelerin çizgi grafiği + kırmızı kesikli eşik çizgisi gösterilir. Sayısal değer üretmeyen durum kontrollerinde (örn. Elasticsearch/Pod/Node Sağlık Durumu) ve hatayla sonuçlanan koşularda, grafik yerine koşu başına renkli bir durum çubuğu gösterilir (yeşil: eşik aşılmadı, kırmızı: eşik aşıldı, turuncu: hata oluştu); çubuğun üzerine gelindiğinde tarih ve sonuç görünür.
- Sonuç kutusu: "Condition met — the alert would fire" (kırmızı), "Condition not met" (yeşil) veya değerlendirme hatası (amber).
Sayfa açıldığında koşul otomatik olarak salt-okunur biçimde değerlendirilir (geçmişe yazmaz); yalnızca Evaluate now butonu geçmişe kayıt yazar.
Alarm Yönetimi
Liste Sayfası Özellikleri
Alarm listesi sayfasında tüm alarmlarınızı görüntüleyebilir ve yönetebilirsiniz.
Arama ve Filtreleme
- Ad arama: Alarm adında geçen ifadeye göre arama yapabilirsiniz (içerir araması)
- Açıklama arama: Alarm açıklamasında geçen ifadeye göre ayrıca arama yapabilirsiniz (içerir araması)
- Proje Filtresi: Alarmları projeye göre filtreleyebilirsiniz (admin listesi tüm projeleri kapsar)
- Durum segmenti: All / Firing (Tetiklenen) / Normal / Disabled (Pasif)
- Kaynak segmenti: All sources / Infrastructure (Altyapı) / Platform / AI — tetiklenme tipi kategorisinden beslenir
Tablo Sütunları
- Alert: Durum noktası + alarm adı (tıklanabilir, Görüntüleme sayfasına gider) + açıklama + ihlal özeti ("N records breached · closest …")
- Trigger type: Tetiklenme tipi + kategori rozeti (Infrastructure/Platform/AI)
- Condition: Koşul (örn.
≥ 85 %,is not healthy,stops arriving) - Current value: Son değerlendirmedeki değer (renkli) + eşik referansı + bar
- Every: Kontrol sıklığı (örn. 5m, 24h)
- Project: Alarmın projesi
- Actions: Bildirim kanalı çipleri
- ⋮: İşlemler menüsü
İşlemler Menüsü
Her alarm için menü butonuna (⋮) tıklayarak şu işlemleri yapabilirsiniz:
- Görüntüle (View): Alarmın Görüntüleme sayfasını (metrikler + Live check + geçmiş) aç
- Düzenle (Edit): Alarm ayarlarını güncelle
- Etkinleştir / Devre Dışı Bırak (Activate/Deactivate): Alarmı aktif/pasif yap
- Çoğalt (Duplicate): Alarmın kopyasını oluştur
- Sil (Delete): Alarmı sil
Durum Değiştirme (Activate/Deactivate)
Alarmın etkin/pasif durumunu değiştirmek için işlemler menüsünden (⋮) Etkinleştir veya
Devre Dışı Bırak'ı seçin. Aynı işlem Görüntüleme ekranının üst barından da yapılabilir.
Yalnızca enabled bayrağı değişir; bildirim alıcıları ve zamanlama korunur. Pasif alarmlar
çalışmaz, ancak geçmiş verileri korunur.
En İyi Uygulamalar
- Açıklayıcı isimler kullanın:
Elasticsearch CPU İzleme - Ortam/Proje öneki ekleyin:
Production - SSL Sertifika Takibi - Tetiklenme tipi belirtin:
K8S Node CPU İzleme
- CPU İzleme: %70-80 arası
- Disk İzleme: %80-90 arası
- Sertifika Takibi: 30-60 gün arası
- Log Sayısı: Sistem kapasitesine göre
- Kritik Sistemler: Her 15-30 dakikada bir
- Genel İzleme: Her saat başı
- Sertifika Takibi: Her gün saat 09:00
- Kaynak İzleme: Her 30 dakikada bir
- Kritik Alarmlar: Email + SMS bildirimi
- Genel Alarmlar: Email bildirimi yeterli
- Webhook: Entegrasyon sistemlerinize bildirim gönderin
- Bildirim Spam: Uygun zamanlama ile bildirim spam'inden kaçının
Sık Sorulan Sorular
Alarm Ne Sıklıkla Çalışır?
Alarmın çalışma sıklığı, oluştururken belirlediğiniz Zamanlama (Cron Expression) ayarlarına bağlıdır. Örneğin:
0 0 * ? * *→ Her saat başı0 */30 * ? * *→ Her 30 dakikada bir0 0 9 * ? *→ Her gün saat 09:00
Alarm Pasif Yapıldığında Ne Olur?
Alarm pasif yapıldığında:
- Yeni kontroller yapılmaz
- Mevcut zamanlanmış işler iptal edilir
- Geçmiş kayıtlar korunur ve görüntülenebilir
- Alarm tekrar aktif yapıldığında normal çalışmaya devam eder
Eşik Değeri Nasıl Belirlenir?
Eşik değeri, sisteminizin normal çalışma koşullarına göre belirlenmelidir:
- CPU İzleme: Normal CPU kullanımının %20-30 üzeri
- Disk İzleme: Disk kapasitesinin %80-90'ı
- Sertifika Takibi: Sertifika yenileme süresinden önce (örn: 30 gün)
- Log Sayısı: Sistem kapasitesine göre
Birden Fazla Bildirim Ekleyebilir miyim?
Evet, birden fazla bildirim ekleyebilirsiniz. Her bildirim:
- Farklı bir tip olabilir (Email, SMS, Webhook vb.)
- Farklı alıcılara gönderilebilir
- Bağımsız olarak aktif/pasif yapılabilir
Geçmiş Kayıtları Ne Kadar Süre Saklanır?
Geçmiş kayıtları, manuel olarak silinene kadar saklanır. Eski kayıtları temizlemek için:
- Geçmiş sayfasında "Tümünü Sil" butonunu kullanabilirsiniz
- Veya kayıtları düzenli olarak temizleyebilirsiniz
Alarm Silindiğinde Ne Olur?
Alarm silindiğinde:
- Alarm tanımı veritabanından silinir
- Tüm geçmiş kayıtları silinir
- Zamanlanmış işler iptal edilir
- Geçmiş veriler kalıcı olarak kaybolur
Uyarı: Silme işlemi geri alınamaz!
Sorun Giderme
Alarm Çalışmıyor
Olası Nedenler:
- Alarm pasif durumda olabilir → işlemler menüsünden Etkinleştir'i seçin (durumu Görüntüleme ekranındaki Configuration sekmesinden doğrulayın)
- Zamanlama ayarları yanlış olabilir → Cron expression'ı kontrol edin
- Elasticsearch bağlantısı yok veya erişilemiyor → Bağlantı ayarlarını kontrol edin
- Eşik değeri yanlış yapılandırılmış olabilir → Eşik değerini kontrol edin
Çözüm:
- Alarm durumunu aktif yapın
- Zamanlama ayarlarını kontrol edin
- Elasticsearch bağlantısını kontrol edin
- Eşik değerini kontrol edin
Tüm Sonuçlar 'Hata Oluştu' Durumunda
Olası Nedenler:
- Elasticsearch bağlantısı yok veya erişilemiyor
- Kubernetes cluster'ına erişilemiyor
- Sistem kaynakları yetersiz
- Yapılandırma hatası
Çözüm:
- Elasticsearch bağlantısını kontrol edin
- Kubernetes cluster bağlantısını kontrol edin
- Sistem kaynaklarını kontrol edin
- Alarm yapılandırmasını kontrol edin
Aynı Alarm Geçmişte Aynı Saatle İki Kez Görünüyor
Olası Neden:
- API Manager birden fazla kopya (replica) ile çalışıyor ve aynı kontrol iki kopyada aynı anda çalışmış
Çözüm:
- API Manager'ı güncel sürüme yükseltin: eş zamanlı çalışan kopyalarda her kontrol artık yalnızca bir kopyada çalışır
- Bir sonraki kontrol aralığından sonra alarm geçmişini tekrar inceleyerek tek satır oluştuğunu doğrulayın
- Tekrar eden kayıtlar sürüyorsa alarmı silip yeniden oluşturun
Çok Fazla Bildirim Geliyor
Olası Nedenler:
- Eşik değeri çok düşük
- Zamanlama çok sık
- Birden fazla bildirim aktif
Çözüm:
- Eşik değerini artırın
- Zamanlama sıklığını azaltın
- Gereksiz bildirimleri pasif yapın
Bildirimler Gelmiyor
Olası Nedenler:
- Bildirim pasif durumda
- Bildirim yapılandırması hatalı
- Email/SMS servisi çalışmıyor
Çözüm:
- Bildirim durumunu aktif yapın
- Bildirim yapılandırmasını kontrol edin
- Email/SMS servis ayarlarını kontrol edin