Cases

OPS-1842 · Incident Ops

Primary saturation on orders-db

SEV-2 · Waiting

  1. 1

    Signal

  2. 2

    Cause

  3. 3

    Plan

  4. 4

    Draft

  5. 5

    Person gate

  6. 6

    Record

Prometheus

orders_db_cpu above 92% for 14 minutes. Connections 480 of 500. Read replica is quiet.

Cause

Checkout retried after a payments timeout and pinned the primary. The write path is the primary. The replica is healthy.

Plan

Restart the primary in the allow-listed window. Do not fail over. Do not touch payments-db.

Draft

Restart orders-db primary

Allow-list · restart-statefulset · Jira OPS-1842

Footprint

CustomersChannelsAPIsServicesAsyncDataHostsRetail customersCustomer · 3Partner channelCustomer · 1storefrontChannel · 2checkoutChannel · 3mobile-appChannel · 4orders-apiAPI · 9payments-apiAPI · 5auth-apiAPI · 1pricing-apiAPI · 3catalog-apiAPI · 2inventory-apiAPI · 3orders.fulfillmentKafka · 4payments.eventsKafka · 2fulfill-workerWorker · 3orders-dbDatabase · 2payments-dbDatabase · 1catalog-dbDatabase · 2card-networkExternal · 1app-node-aHost · 2app-node-cHost · 1

Person gate

The write waits here.

Restart orders-db primary is on the allow-list (restart-statefulset). It does not run until you decide.

  • JiraDry-run
  • PrometheusDry-run
  • KubernetesDry-run