Silicon Crew / Project Console

Evidence cut / 2026-09-05

YOLO26n 四芯粒无 DDR 加速器
项目方案与进展

面向 28 nm、4 个同构计算 die、512 输入和 20 FPS 的工程监控台。此页记录当前可复现证据与尚未闭环的签核条件,不把容量推导或模块级仿真表述为系统性能结论。

目标:YOLO26n e2e W8A8 架构:D0-D3 / 16-bank SRAM 状态:条件可行,未签核 系统级 20 FPS:尚未证明
冻结模型 已接受 512 静态 ONNX,SHA-256 固定
D2D 控制面 XSim 通过 包头、CRC、路由、信用与端点
SRAM 方案 条件可行 32 行 band,仅一帧激活数据
量产签核 未开始 宏、PPA、STA、功耗与热

项目方案

首版锁定 4-die YOLO26n,而非将更大模型或 CIM 作为基本功能前提。

四芯粒流水与角色分区

CPU 只负责启动、配置、遥测和异常恢复;帧内执行由每个 die 的本地调度器、描述符和 scoreboards 驱动。

Camera bridgeDVP/FPGA bridge
512 RGB/A8 输入
D0M0-M4
Stem / P3
D1M5-M8
P4 / P5
D2M9-M18
SPPF / PSA / FPN
D3M19-M23
PAN / PSA / Detect
Top-300300 x 6 结果
反向回 bridge

关键边界:D0-D1 1.00 MiB/frame,D1-D2 0.6875 MiB/frame,D2-D3 0.50 MiB/frame。静态载荷投影远低于 350 MB/s 的目标有效带宽,但尚非实测链路预算。

  • 模型与数值YOLO26n e2e;Conv/DWConv 使用 W8 + B32 + A8,累加 INT32;PSA、Softmax 与尾部仍有待完成的精度与硬件闭环。
  • 存储边界每 die 规划 1.45 MiB 可用 SRAM、16 个 bank;运行时不使用 DDR。四个 frame context 仅保存元数据,不代表四帧 activation 常驻。
  • 互连边界双端口、x8、源同步 D2D;128-bit flit、最大 256 B payload、VC packet credit、CRC 与逐跳转发。
  • 输入边界摄像头置于外部 bridge;D0 按行/band 接收,不物化完整 RGB 帧。ZCU106 无 DDR 路径是后续板级验证对象。

证据账本

模型、图与边界 ABI

已验证

固定 512 ONNX;384 nodes、629 tensors;D0-D3 分区与六个真实跨 die tensor 已生成并受 manifest 约束。

tools/inspect_yolo26n_onnx.py · generate_yolo26n_e2e_artifacts.py

W8A8 编译与精度

烟雾级

102 个 Conv/DWConv 常量、非 Conv 合约与 e2e Top-300 参考已建立;校准仅来自两张本地图像,不能作为部署精度结论。

tools/compile_yolo26n_conv_w8a8.py · compile_yolo26n_nonconv_w8a8.py

Band SRAM 分配

条件可行

16 个候选中 9 个可放入。选定 32 行、双 ping-pong,单活跃帧 + 四 context 元数据在 1.45 MiB 限额内。

multidie/yolo26n_band_streaming_sram_allocation.md

D2D 包与控制面

XSim 通过

Header/Trailer/CRC32C、VC credit、路由、RX policy、序列保护与帧上下文调度器有独立回归。

rtl/d2d/ · rtl/scheduler/ · multidie/test_d2d_packet.py

计算与算子原语

局部证据

真实 Conv/DW 像素向量、banked SRAM Conv、SiLU/Add/SPPF/resize 与 PSA 子模块存在 XSim 证据;全图 traversal 未完成。

rtl/target/ · rtl/operators/ · rtl/integration/

可扩展 D2D 数据面

未闭环

多 slot、CDC FIFO、bounded DMA 与 watchdog 已验证,但 ABORT 包、descriptor/FIFO 清理、重放与 PHY retrain 尚未完成。

multidie/STATUS.md / D2D scalable data plane

无 DDR 板级路径

部分完成

ZCU106 no-DDR 的 BD 预检、静态 guard 与 frame ingress XSim 已通过;尚无 XSA、ELF、camera bridge、bitstream 或板上运行。

zcu106_noddr/ · multidie/STATUS.md

ASIC 物理签核

尚未开始

没有 SRAM macro、综合、布局布线、STA、功耗、热或封装/D2D 约束签核。3 x 3 mm 与 20 FPS 因此不能视为已证明。

multidie/yolo26n_full_frame_capacity_audit.md

资源与吞吐约束

所示为已绑定审计的容量余量,不是时序或帧率结果。

从“无法放下整帧”到 band streaming

全帧审计显示 D1/D2 的同时 inbound/outbound 物化超过 1.45 MiB,且 D0 的首层输出就达 1.00 MiB。因此项目不再以整帧 tensor 常驻为前提。

当前 32 行方案把动态张量改为 HWC16 band,并为本地、D2D、输入各保留双缓冲。该设计必须继续落实为逐层 micro-op、bank 时序与实际 DMA/链路调度。

Die组合峰值1.45 MiB 占用余量
D01.020 MiB
0.430 MiB
D11.009 MiB
0.441 MiB
D21.143 MiB
0.307 MiB
D31.255 MiB
0.195 MiB

下一关与退出条件

按风险优先级排序,完成前不能将项目标记为端到端可交付。

GATE 01

部署级量化

至少 32 张代表图像校准,完成 COCO-512 准确率报告和阈值签核,替代当前单烟雾样本。

GATE 02

全算子端到端闭环

输出有版本的 all-operator lowering、数字向量和多层 RTL 等价证据,覆盖 PSA 与 tail。

GATE 03

按周期的资源证明

将 band、lifetime、bank、DMA、credit 与 micro-op 调度绑定,验证四 context 下的链路恢复与时延。

GATE 04

硬件与物理签核

完成 no-DDR 板上运行后,导入 SRAM macro 与 foundry 流程,取得 PPA、STA、功耗、热及 24 h 稳定性证据。

证据索引

监控台快照的主要来源。

当前总账yolo26_accelerator/multidie/STATUS.md截至 2026-09-05 的工程证据、回归命令与立即退出条件。
全帧容量审计yolo26_accelerator/multidie/yolo26n_full_frame_capacity_audit.md明确给出 NOT_PROVEN 与完整缺口清单。
Band 分配审计yolo26_accelerator/multidie/yolo26n_band_streaming_sram_allocation.md32 行候选、每 die 峰值和适用假设。
银行冲突审计yolo26_accelerator/multidie/yolo26n_band_bank_conflict_audit.mdConv 读/写/D2D DMA 的 bank-role witness。
芯片系统方案four_die_yolo26n_integrated_system_plan_20260904.md目标、边界、D2D、相机 bridge 与执行方案。