어떤 증상인가

분산 트랜잭션 문제가 나타난 입력, 직전 동작과 실제 결과를 함께 적습니다. 예를 들어 “가끔 실패”라고 쓰는 대신 정상 사례와 실패 사례를 하나씩 두고, 두 사례에서 달라진 version·설정·데이터를 표로 남깁니다.

사례 입력과 상태 결과
정상 가장 작은 정상 조건 기대한 결과
실패 한 조건만 달라진 재현 실제 오류·값

원인을 좁히는 순서

여러 service의 atomic commit은 availability와 운영 복잡성 비용이 커서 보상·상태 기계와 각 단계의 idempotency를 먼저 검토합니다.

동시성 문제는 단일 성공으로 확인할 수 없습니다. 자원 획득 순서, transaction 범위, retry와 timeout을 그린 뒤 lock owner·waiter와 중복 요청 ID를 같은 시각으로 모읍니다. 결정 기록, dependency graph, 변경 빈도, 장애 반경과 실제 trace를 함께 검토한다. 정상과 실패를 번갈아 실행하고, 이 원인이 맞다면 달라져야 할 값부터 확인합니다. 관련 없는 로그와 설정을 한꺼번에 바꾸지 않습니다.

수정하고 확인하기

lock 순서를 일관되게 하고 critical section을 줄이며 DB 제약과 idempotency key로 최종 불변식을 지킵니다. retry에는 횟수 제한, backoff와 jitter를 두고 이미 반영됐을 가능성을 먼저 확인합니다. 일관성 요구와 실패 비용을 먼저 적고 가장 단순한 경계에서 시작해 측정된 압력에 따라 분리한다.

수정 전 실패 사례가 사라지고 기존 정상 사례가 유지돼야 합니다. 대표 변경 시나리오, 실패 주입, 부하와 복구 시간으로 설계 가정을 검증한다. barrier를 사용한 동시 테스트와 실패 주입으로 중복 결과, 교착, lost update와 retry 폭풍이 없는지 검증합니다. 가장 작은 실패 입력은 자동 테스트나 실행 가능한 점검 명령으로 남깁니다.

공식 문서와 적용 범위

문서의 기본값과 동작은 version에 따라 달라질 수 있습니다. 현재 version, 실제 적용 설정, 자원 제한과 운영 환경에서 다시 확인합니다.