AI DATA MOVEMENT · MEMORY SYSTEMS · INTERCONNECT · RTL
From the hardware's side, an inference run is a traffic pattern. I work on reading that pattern off real workloads, and on what follows from it: memory systems, on-chip and chip-to-chip networks, and the RTL underneath.
VIEW
ONE TRANSFORMER LAYER DURING ONE DECODE STEP · B = 1
EVENT ORDER ONLY · NOT A LATENCY SCALE · SERIAL CACHE-FIRST DEPICTION
01RMSNORM
02Q/K/V PROJ
03ROPE (Q,K)
04KV APPEND
05ATTENTION
06O PROJ
07+ LAYER INPUT
08RMSNORM
09MLP
10+ POST-ATTN STATE
11UNSHOWN WORK
STAGE HIGHLIGHT MEANS "BEING EXPLAINED, POSSIBLY WAITING". COMPUTE-ACTIVE IS THE SEPARATE MARK ON THE COMPUTE BAND. Q/K/V AND MLP EXPAND INTO SEVERAL OPERATIONS; NORM SCALE VECTORS AND ON-CHIP ACTIVATION MOVEMENT ARE NOT DRAWN HERE.
PARTIAL SUM FROM ROW 0 DOWN COLUMN 1 · T01->T11 · AFTER T01 COMPUTES z[0,1] · FOR ACCUMULATE ROWS 0,1 IN COLUMN 1
OUTPUT
y[J0] PENDING · COLUMN SUM HOLDS ROWS 0 · y[J1] PENDING · COLUMN SUM HOLDS ROWS 0 · y[J2] PENDING · COLUMN SUM HOLDS ROWS -
RULE
A TILE COMPUTES ONLY WITH ITS OWN W BLOCK AND ITS ROW ACTIVATION IN HAND
ONE TRANSFORMER LAYER DURING ONE DECODE STEP, BATCH SIZE ONE, DRAWN FROM A VALIDATED EVENT LEDGER. EVENT ORDER ONLY: EQUAL-WIDTH STAGES ARE NOT EQUAL LATENCIES, AND NOTHING HERE IS A MEASUREMENT. THE SCHEDULE IS A CHOSEN SERIAL, CACHE-FIRST ILLUSTRATION — AN IMPLEMENTATION MAY PREFETCH, OVERLAP, FUSE, OR KEEP THE CURRENT K AND V ON CHIP INSTEAD OF WRITING THEM OUT AND READING THEM BACK. OPERAND DEMAND IS QUALITATIVE; NO ELEMENT HERE IS MEASURED HBM, NOC OR PE UTILIZATION.ONE BLOCK MATRIX–VECTOR PRODUCT y = W x, AS AN ILLUSTRATIVE MAPPING, NOT A GPU FLOORPLAN. TILE (r,c) OWNS W[J_c, I_r]; THE ROW ACTIVATION SLICE x[I_r] IS REUSED ALONG THE ROW; PARTIAL SUMS REDUCE DOWN THE COLUMN INTO THE OUTPUT SLICE y[J_c]. DEPENDENCY-VALID ORDER, NOT A CYCLE-ACCURATE NOC SIMULATION: NO ARBITRATION, BANDWIDTH OR CONTENTION IS MODELLED.