Files
msgexchange-v2/src/main/kotlin/com/gzzn/omms/msgexchange/processing/BackfillService.kt
T
windyboy 817236ca26 fix(processing): 落地 D1/D5/D6 三项裁决,删除 head-deadline 参数
D5(终态判据只保留尝试上限):
- Pump.tick 内联 attempts 判定,删除 head-deadline 相关的毒丸分支与滞留告警代码
- 删除配置项 head-deadline(PipelineProps / application.yml)与 PumpDeadlineTest
- PROCESSING_STARTED_AT 变为只写,注释如实说明当前无判据消费它

D1(回填放弃判据改为时间):
- 暂时性故障在 R 之前只退避重试,不再按尝试次数放弃;到 R 才放弃并记 TRANSIENT_DEADLINE
- backfill-max-attempts 降级为单行重试的告警阈值

D6(超期判据改用本地入队时间):
- 新增 V6 迁移:PROC_STATE 加 ENQUEUED_AT(回填存量后置为非空 + 默认)
- findBackfillDue 的谓词与 overdue 标记改比较 enqueued_at,不再用库方时钟的 received_at
- BackfillDue 增加 overdue;收报与兼容入口显式写入本地入队时间

文档同步:
- 清理 4 处 message-lifecycle.md 章节号死链(Pump/InboxService/PipelineProps/application.yml)
- 关闭 G-HEAD-DEADLINE、G-BACKFILL-ABANDON-BYTIME、G-ENQUEUED-AT 三条缺口登记
- reference/user-stories/README 与实现对齐

验证:./gradlew test ⇒ 122 tests, 0 failures, 1 skipped

Refs: ACM2-45
2026-09-11 20:44:30 +08:00

145 lines
7.4 KiB
Kotlin

package com.gzzn.omms.msgexchange.processing
import com.gzzn.omms.msgexchange.config.MailboxProps
import com.gzzn.omms.msgexchange.config.PipelineProps
import com.gzzn.omms.msgexchange.domain.ProcStatus
import com.gzzn.omms.msgexchange.infra.persistence.CminmsgInboxRepository
import com.gzzn.omms.msgexchange.infra.persistence.MailboxMarkResult
import com.gzzn.omms.msgexchange.infra.persistence.ProcStateRepository
import jakarta.inject.Singleton
import java.time.Clock
import java.time.Duration
import java.time.Instant
/**
* 把"已处理"标记写回共享信箱。
*
* 一条消息处理完要做两件事:记下终态、把标记写回信箱。第一件在业务事务里完成,
* 同时留下"还欠一次回填"的意图(PROC_STATE 上的 BACKFILL_NEXT_AT);
* 这个类负责第二件:
*
* - [attempt]:单行写标记,只由 [sweep] 逐行调用——主泵与处理器不直接调它(回填一律扫描驱动)。
* - [sweep]:定时把还欠回填的记录挑出来重试。失败按 30 秒起步、最长 15 分钟的退避往后推;
* 入队时间早于 `NOW − R` 的行无视退避、每轮都试。
*
* 放弃判据是**时间**(`R` 超期)而不是尝试次数:一次小时级的共享库故障不该把待回填行成批
* 判死、再要求人工成批恢复。`R` 之前只退避重试;到 `R` 仍未打标才停止自动重试并进放弃清单
* (保留 [reopen] 人工恢复)。`backfill-max-attempts` 因此降级为单行重试的告警阈值。
*
* 两条底线:回填失败不会把终态改回去,也不会重新执行业务逻辑;写标记只写还是空标记的
* 行,重复执行没有副作用。
*/
@Singleton
class BackfillService(
private val procState: ProcStateRepository,
private val mailbox: CminmsgInboxRepository,
private val mailboxProps: MailboxProps,
private val props: PipelineProps,
private val clock: Clock,
/** 与人工重放共用的互斥门;`internal` 以便装配测试断言两者拿到同一实例。 */
internal val lifecycleGate: MessageLifecycleGate,
) {
private val log = org.slf4j.LoggerFactory.getLogger(BackfillService::class.java)
companion object {
private val INITIAL_BACKOFF: Duration = Duration.ofSeconds(30)
private val MAX_BACKOFF: Duration = Duration.ofMinutes(15)
private val TERMINAL_STATES = setOf(ProcStatus.SUCCEEDED, ProcStatus.SKIPPED, ProcStatus.DEAD)
/** 放弃原因:运行时查询确认信箱行不存在(确定性结论,重试不会改变结果)。 */
const val ABANDON_MISSING_ROW = "MISSING_ROW"
/** 放弃原因:暂时性故障持续到 `R` 仍未打标;停止自动重试,但保留人工恢复能力。 */
const val ABANDON_TRANSIENT_DEADLINE = "TRANSIENT_DEADLINE"
fun backoffDelayFor(attempts: Int): Duration {
val shift = (attempts - 1).coerceIn(0, 20)
return INITIAL_BACKOFF.multipliedBy(1L shl shift).coerceAtMost(MAX_BACKOFF)
}
}
/**
* 处理完立刻试一次。失败只记一笔退避信息就返回,不抛异常——
* 调用方是主泵的处理路径,不能被回填问题拖住。
*/
/**
* @param overdue 该行入队时间早于 `NOW − R`(已进入强补写窗口)。通常来自 [sweep] 的扫描结果;
* 直接调用默认 false,即按普通退避处理。
*/
fun attempt(msgId: Long, overdue: Boolean = false, now: Instant = clock.instant()) {
lifecycleGate.exclusive {
val row = procState.find(msgId) ?: return@exclusive
if (row.state !in TERMINAL_STATES) return@exclusive
if (row.backfillAt != null) return@exclusive
if (row.backfillAbandonedAt != null) return@exclusive
record(msgId, attempts = row.backfillAttempts, overdue = overdue, now = now)?.let {
log.warn("backfill failed msgId={} error={} (sweep will retry)", msgId, it)
}
}
}
/**
* 人工恢复入口:清除放弃标记并重排一次回填。
* 用于暂时性故障恢复之后,或人工对账确认该行仍应打标之后。
*/
fun reopen(msgId: Long, now: Instant = clock.instant()): Boolean =
lifecycleGate.exclusive { procState.reopenBackfill(msgId, now) }
/**
* 批量补写,由 JobRunner 每 30 秒调用一次。待办状态都在数据库里,
* 进程重启后接着跑,不需要额外恢复步骤。
*
* 注意:**调度周期不是完成时限**——扫描与历史作业串行,批次积压、单行调用超时与
* 历史作业耗时都会延长实际回填延迟。
*
* @return 本批处理的条数
*/
fun sweep(now: Instant = clock.instant()): Int {
val due = procState.findBackfillDue(now, now.minus(props.pipeline.overdueBackfill), props.pipeline.backfillBatch)
due.forEach { attempt(it.msgId, it.overdue, now) }
return due.size
}
/** 回填一条。@return 失败原因;返回 null 表示已处理完(写成功/早已标记/已放弃)。 */
private fun record(msgId: Long, attempts: Int, overdue: Boolean, now: Instant): String? =
try {
when (mailbox.markProcessedIfUnmarked(msgId, mailboxProps.processedValue)) {
MailboxMarkResult.MARKED, MailboxMarkResult.ALREADY_MARKED -> {
// 没有真正写进去说明库里已经有标记了,同样算成功(不覆盖已有值)
procState.markBackfilled(msgId, now)
null
}
MailboxMarkResult.MISSING -> {
// 确定性结论:行不存在,重试不会改变结果。停止自动补偿并把事实留痕。
// 这**不等于**标记已确认(BACKFILL_AT 仍为空),清除前提因此仍然不成立。
procState.markBackfillAbandoned(msgId, ABANDON_MISSING_ROW, now)
log.error("backfill abandoned: mailbox row missing msgId={}", msgId)
null
}
}
} catch (e: Exception) {
// 超时/连接失败是暂时性的,**不能**当作缺行证据,也不能按次数放弃:
// 按退避重试,直到入队时间超过 R 才停止自动重试(保留人工恢复能力)。
val reason = e.message ?: e.javaClass.simpleName
val nextAttempts = attempts + 1
if (overdue) {
runCatching { procState.markBackfillAbandoned(msgId, ABANDON_TRANSIENT_DEADLINE, now) }
.onFailure { log.error("abandon backfill failed msgId={}", msgId, it) }
log.error("backfill abandoned at R msgId={} attempts={} error={}", msgId, nextAttempts, reason)
} else {
runCatching {
procState.recordBackfillFailure(msgId, reason, nextAttempts, now.plus(backoffDelayFor(nextAttempts)), now)
}.onFailure { log.error("record backfill failure failed msgId={}", msgId, it) }
if (nextAttempts >= props.pipeline.backfillMaxAttempts) {
log.warn(
"backfill retries for msgId={} reached the warning threshold ({}); " +
"still retrying until R elapses — 放弃判据是 R 超期,不是次数",
msgId, props.pipeline.backfillMaxAttempts,
)
}
}
reason
}
}