먼저 재현할 문제

API 재시도와 중복 요청 문제가 나타난 입력, 직전 동작과 실제 결과를 함께 적습니다. 예를 들어 “가끔 실패”라고 쓰는 대신 정상 사례와 실패 사례를 하나씩 두고, 두 사례에서 달라진 version·설정·데이터를 표로 남깁니다.

사례 입력과 상태 결과
정상 가장 작은 정상 조건 기대한 결과
실패 한 조건만 달라진 재현 실제 오류·값

증거에서 원인 찾기

timeout은 server가 작업을 반영하지 않았다는 뜻이 아니므로 retry 가능한 쓰기에는 idempotency key나 DB 불변식이 필요합니다.

동시성 문제는 단일 성공으로 확인할 수 없습니다. 자원 획득 순서, transaction 범위, retry와 timeout을 그린 뒤 lock owner·waiter와 중복 요청 ID를 같은 시각으로 모읍니다. 요청 ID로 navigation timing, HTTP 상태, upstream 시간과 서버 trace를 같은 시간축에 놓는다. 정상과 실패를 번갈아 실행하고, 이 원인이 맞다면 달라져야 할 값부터 확인합니다. 관련 없는 로그와 설정을 한꺼번에 바꾸지 않습니다.

최소 수정과 재확인

lock 순서를 일관되게 하고 critical section을 줄이며 DB 제약과 idempotency key로 최종 불변식을 지킵니다. retry에는 횟수 제한, backoff와 jitter를 두고 이미 반영됐을 가능성을 먼저 확인합니다. 실패 경계를 먼저 확정하고 가장 안쪽 원인을 수정한 뒤 timeout과 재시도 예산을 바깥 계층까지 맞춘다.

수정 전 실패 사례가 사라지고 기존 정상 사례가 유지돼야 합니다. 실사용자 지표와 부하 테스트에서 p50/p95/p99, 오류율, 처리량과 자원 포화를 함께 비교한다. barrier를 사용한 동시 테스트와 실패 주입으로 중복 결과, 교착, lost update와 retry 폭풍이 없는지 검증합니다. 가장 작은 실패 입력은 자동 테스트나 실행 가능한 점검 명령으로 남깁니다.

공식 문서와 적용 범위

문서의 기본값과 동작은 version에 따라 달라질 수 있습니다. 지원하는 browser, viewport, 입력 방식과 실제 network 조건에서 다시 확인합니다.