IoTSharp/Sezika

Multilingual, non-autoregressive System 1 decision engine in C# and .NET 10. Native AOT and C# GPU kernels via device drivers.

C#

5

21 commits

updated Oct 4, 2026

See the code

README

Sezika

Multilingual, non-autoregressive System 1 decision engine.

Sezika 面向本地软件中的语义判断,目标是使用 C#、.NET 10 与 Native AOT,把文本或结构化状态转换为类型化决策与概率分布。模型、CPU/GPU 算子及调度以 C# 实现,GPU 运行时允许调用系统显卡驱动。

文本 / JSON 状态 + 类型化问题 + 候选标准
                ↓
      多语言编码器 → 决策头 → 概率分布(当前未校准)
                ↓
       Choice / Score / Boolean
                ↓
      调用方判断、拒答或转入生成模型

项目状态

当前仓库包含可运行的纯 C# scalar/SIMD FP32 与 W8A32 encoder/head、固定真实 Laya/mmBERT 开发资产的安全加载、Choice/Score/Boolean typed decision、tokenizer oracle、校准评估器,以及 ILGPU 构建期 PTX/ABI 和 CUDA Driver 完整推理路径。S5-04/S5-05 已完成:Windows win-x64 Native AOT 四后端各覆盖 1/8/32 问、每项 5 次正式采样;Ubuntu WSL2 linux-x64 四后端通过真实模型 Native AOT smoke,各为 3 问、1 次采样。WSL smoke 不代表裸机 Linux 性能;逐语言质量仍未验收,模型权重不随仓库发布。 具体范围见 S5 性能与 AOT 证据及原始报告。

2026-09-30 已完成独立 jhu-clsp/mmBERT-base 原始权重/tokenizer 的固定 hash 核验、纯 C# 受限转换、decision-v1 输入和独立 encoder CPU smoke;项目自有中英三题型 head 仅完成 12 条 train/development 开发 smoke。该独立资产尚未替换默认 Laya 路径,也没有通过上游逐层数值、许可发布、校准、封存质量或 CUDA/AOT 门槛;证据见 S4 独立模型报告。

当前 W8A32 路径慢于 SIMD,且在保留 FP32 原权重之外增加量化缓存,没有降低总驻留内存。数值对齐、真实推理、AOT 与语言质量分别验收,不将量化实现视为已经取得性能或内存收益。

2026-09-25 已完成固定 Laya 的 46 条真实 oracle 捕获,并修正题型前缀、候选渲染/顺序、JSON 文本和 256 前缀 / 1024 总长度语义。SIMD 与 CUDA 各在 38 条支持范围内的回答上通过冻结数值容差,4 条非法输入的失败语义一致;另 4 条候选数量合同差异明确保留,不能声称全上游合同通过。请求默认严格拒绝截断,显式 length_policy: "laya_compatible" 才采用兼容截断并返回诊断。详见输入合同与真实数值证据。

2026-09-25 solution 构建为 0 警告/0 错误,输入与运行时、资源、CUDA 诊断分别通过 137/35/43 项检查;数据隔离与性能画像工具已同步到该次构建。2026-09-26 又完成修正路径的两 RID Native AOT 长输入回归:win-x64 / Ubuntu WSL2 linux-x64 的输入契约各138项通过,SIMD/CUDA各38条真实回答+4条非法拒绝通过冻结合同,scalar各3条长输入通过;4条候选数量差异继续保留。修正后的质量和性能仍分别验收,旧报告继续限定于原有输入实现。执行依赖与剩余门槛见 路线图。

Scalar 另完成三题型×中英×短中长的 18 条核心数值对照。token 覆盖率重测显示 PAWS 在 strict/compatible 下均为 250/250,Nimble 为 strict 306/324、compatible 324/324;这些是输入可构造率,不是推理成功率或答案正确率。

2026-09-26 的本轮质量复测已把独立 Laya 与 C# CUDA 逐题数值比较扩展到 PAWS 250 + Nimble 324,共574/574条通过。全量参考发现并推动修复了 tokenizer 的 added-token 边界问题;修复后同一构建重新捕获全部题目,两实现分别答对 170/250(68.00%) 和 137/324(42.28%),本轮均使用 laya_compatible。另12条原创中英fixture全部通过数值对比,双方8/12正确;该小型公开样本不构成语言质量验收。Nimble Boolean负类召回仍仅1/57,概率未校准,外部题集语言仍记 unspecified。

此前构建的Nimble strict实测处理全324题:306题实际推理,133题正确,已答准确率43.46%,按全部处理题计为41.05%;18题在forward前因需要截断而拒绝。该历史报告保留原程序身份,不与本轮tokenizer修复后的compatible结果混合。

本轮分层诊断已补齐三题型×中英×短中长 18 组、54 个三后端输出,全部满足冻结输出合同,SIMD/CUDA 共记录 972 次完整张量诊断;首次超时与后续补齐分别保留。全量质量参考暴露并推动修复了 tokenizer 的 added-token 边界缺陷,修复后另通过 267 条独立分词参考、137 项输入契约和受影响案例三后端真实回归。内部层诊断仍缺独立上游张量及冻结阈值;新 tokenizer 实现的 AOT 尚未重测。各构建的数值、质量和性能证据按程序集哈希分别记录。

本轮性能工具验证在普通 .NET 10.0.11 / i9-13900HX / RTX4070 Laptop 下记录:CUDA long-32的end_to_end单样本 38.319秒,独立分项明确未测;SIMD long-1为 42.183秒。据当前单题耗时估算CPU long-32的discovery与正式两遍约45分钟,超过工具30分钟总上限,本轮未启动该格。受控CUDA截止测试正确保留3次进入、2次完成、0正式样本及资源回收证据。历史九格画像和CPU 300秒失败继续保留;这些数据不构成稳定尾延迟、新AOT性能或优化收益声明。

独立使用

Sezika 可以独立加载固定模型包并执行决策。先按独立使用说明准备并验证模型资产;在仓库根目录执行:

dotnet build Sezika.slnx -c Release
dotnet run --project src/Sezika.Cli -c Release --no-build -- inspect --model .artifacts/models/laya-mmbert
dotnet run --project src/Sezika.Cli -c Release --no-build -- predict --model .artifacts/models/laya-mmbert --input samples/requests/decision.zh.json --deadline-seconds 300

predict 使用 CPU 返回 Choice、Score、Boolean 的 JSON 答案;中文与英文请求均可直接修改。inspect 是固定资产预检查,完整张量配置仍在加载时验证。C# 宿主可以使用 DecisionModelRuntime.Load(...) 和 Evaluate(...) 复用同一 session;API 示例和输出语义见独立使用说明。当前结果为 uncalibrated;开发期 CLI 尚未正式发布。

决策原语

原语语义输出
Choice从请求给定的有限候选中选择选中项、完整概率分布、集中度
Score按有序 rubric 评分概率加权期望、各级概率、等级说明
Boolean判断命题成立的可能性P(true);外部兼容层可映射为 noul

适用方向包括意图识别、模型/工具路由、RAG 候选重排、内容判断和结果核验。决策引擎返回建议,由调用方控制动作与权限;开放式回复由生成模型承担。

技术边界

  • 首个候选架构采用 mmBERT-base 类多语言 encoder 加类型化决策头。权重、tokenizer 和训练数据逐项审核许可,独立于引擎代码发布。
  • 基础推理使用 C# 实现算子,不依赖 Python、PyTorch、ONNX Runtime、cuBLAS/cuDNN 或另一服务进程。开发阶段可使用固定参考实现生成数值对照数据。
  • GPU 已通过 NVIDIA CUDA Driver 路径:C# kernels 在构建期由 ILGPU 1.5.3 导出 PTX/ABI,Native AOT 通过静态 Driver 绑定执行完整 encoder/head;不使用 cuBLAS/cuDNN。
  • 类库静态纳入宿主;使用 source-generated JSON,保持 Native AOT/trimming 可分析性。
  • 模型资产、context、问题/候选数量、并发、工作空间和取消均有明确边界。
  • 多语言能力逐语言评测;概率、分布集中度、校准有效范围与拒答分别表达。

文档与工程

  • 独立使用:固定模型准备、CLI、C# 调用和决策输入输出。
  • 参考项目分析:Laya 的可审计模型实现,以及 TypeSafe Jev 的公开协议与边界。
  • 下一阶段研究:Sezika、Laya、Jev、Nimble 的路线比较,CPU/CUDA 优化、双模型训练与 IoTSharp 集成计划。
  • 修正路径质量证据:完整题集的真实模型结果、有限独立参考和可核查的 forward 证据;旧输入报告单独保留。
  • Laya oracle 合同、C# 真实捕获与数值对照证据:固定源码/资产/输入/容差,保留完整清单差异和支持范围的 token、marker、logits 验收结果。
  • 数据隔离审计:来源、许可、用途、家族/实体/近重复与封存声明检查;示例不代表获准训练的数据集。
  • 长输入性能画像:当前渲染路径的真实短/中/长与 1/8/32 问请求,实际输入、端到端耗时、分项与资源证据;工具说明列出复现方法和计时口径。
  • 架构设计:推理路径、模型资产、契约、校准与资源约束。
  • 纯 C# GPU 与 Native AOT:ILGPU 编译期边界、CUDA Driver 路径及最小验证关口。
  • S5 性能与 AOT 证据:Windows 四后端基准、Ubuntu WSL2 真实模型 AOT smoke、计时与内存边界。
  • 阶段路线图:实现顺序、验收条件与工作量判断。
  • 闭环审计:逐阶段证据、状态与剩余条件。
  • src/Sezika:.NET 10 核心类库、模型加载、tokenizer、CPU encoder 与 typed decision engine。
  • English

真实模型、CUDA 与 AOT 命令及实测结果见 阶段证据 和 GPU/AOT 设计。旧输入实现的首轮 PAWS 结果低于多数类基线;修正后本固定集为 68%,但已查看题集不能用于选参或冒充新封存测试。多语言质量、裸机 Linux 性能和更充分的尾延迟采样仍需独立证据。

开源许可

自有代码使用 Apache License 2.0。研究参考与第三方资产边界见 THIRD_PARTY_NOTICES.md。本项目不声称复现 Jev 的闭源模型,也不继承上游的速度或质量结论。

IoTSharp/Sezika

Multilingual, non-autoregressive System 1 decision engine in C# and .NET 10. Native AOT and C# GPU kernels via device drivers.

C#

5

21 commits

updated Oct 4, 2026

See the code

README

Sezika

Multilingual, non-autoregressive System 1 decision engine.

Sezika 面向本地软件中的语义判断,目标是使用 C#、.NET 10 与 Native AOT,把文本或结构化状态转换为类型化决策与概率分布。模型、CPU/GPU 算子及调度以 C# 实现,GPU 运行时允许调用系统显卡驱动。

文本 / JSON 状态 + 类型化问题 + 候选标准
                ↓
      多语言编码器 → 决策头 → 概率分布(当前未校准)
                ↓
       Choice / Score / Boolean
                ↓
      调用方判断、拒答或转入生成模型

项目状态

当前仓库包含可运行的纯 C# scalar/SIMD FP32 与 W8A32 encoder/head、固定真实 Laya/mmBERT 开发资产的安全加载、Choice/Score/Boolean typed decision、tokenizer oracle、校准评估器,以及 ILGPU 构建期 PTX/ABI 和 CUDA Driver 完整推理路径。S5-04/S5-05 已完成:Windows win-x64 Native AOT 四后端各覆盖 1/8/32 问、每项 5 次正式采样;Ubuntu WSL2 linux-x64 四后端通过真实模型 Native AOT smoke,各为 3 问、1 次采样。WSL smoke 不代表裸机 Linux 性能;逐语言质量仍未验收,模型权重不随仓库发布。 具体范围见 S5 性能与 AOT 证据及原始报告。

2026-09-30 已完成独立 jhu-clsp/mmBERT-base 原始权重/tokenizer 的固定 hash 核验、纯 C# 受限转换、decision-v1 输入和独立 encoder CPU smoke;项目自有中英三题型 head 仅完成 12 条 train/development 开发 smoke。该独立资产尚未替换默认 Laya 路径,也没有通过上游逐层数值、许可发布、校准、封存质量或 CUDA/AOT 门槛;证据见 S4 独立模型报告。

当前 W8A32 路径慢于 SIMD,且在保留 FP32 原权重之外增加量化缓存,没有降低总驻留内存。数值对齐、真实推理、AOT 与语言质量分别验收,不将量化实现视为已经取得性能或内存收益。

2026-09-25 已完成固定 Laya 的 46 条真实 oracle 捕获,并修正题型前缀、候选渲染/顺序、JSON 文本和 256 前缀 / 1024 总长度语义。SIMD 与 CUDA 各在 38 条支持范围内的回答上通过冻结数值容差,4 条非法输入的失败语义一致;另 4 条候选数量合同差异明确保留,不能声称全上游合同通过。请求默认严格拒绝截断,显式 length_policy: "laya_compatible" 才采用兼容截断并返回诊断。详见输入合同与真实数值证据。

2026-09-25 solution 构建为 0 警告/0 错误,输入与运行时、资源、CUDA 诊断分别通过 137/35/43 项检查;数据隔离与性能画像工具已同步到该次构建。2026-09-26 又完成修正路径的两 RID Native AOT 长输入回归:win-x64 / Ubuntu WSL2 linux-x64 的输入契约各138项通过,SIMD/CUDA各38条真实回答+4条非法拒绝通过冻结合同,scalar各3条长输入通过;4条候选数量差异继续保留。修正后的质量和性能仍分别验收,旧报告继续限定于原有输入实现。执行依赖与剩余门槛见 路线图。

Scalar 另完成三题型×中英×短中长的 18 条核心数值对照。token 覆盖率重测显示 PAWS 在 strict/compatible 下均为 250/250,Nimble 为 strict 306/324、compatible 324/324;这些是输入可构造率,不是推理成功率或答案正确率。

2026-09-26 的本轮质量复测已把独立 Laya 与 C# CUDA 逐题数值比较扩展到 PAWS 250 + Nimble 324,共574/574条通过。全量参考发现并推动修复了 tokenizer 的 added-token 边界问题;修复后同一构建重新捕获全部题目,两实现分别答对 170/250(68.00%) 和 137/324(42.28%),本轮均使用 laya_compatible。另12条原创中英fixture全部通过数值对比,双方8/12正确;该小型公开样本不构成语言质量验收。Nimble Boolean负类召回仍仅1/57,概率未校准,外部题集语言仍记 unspecified。

此前构建的Nimble strict实测处理全324题:306题实际推理,133题正确,已答准确率43.46%,按全部处理题计为41.05%;18题在forward前因需要截断而拒绝。该历史报告保留原程序身份,不与本轮tokenizer修复后的compatible结果混合。

本轮分层诊断已补齐三题型×中英×短中长 18 组、54 个三后端输出,全部满足冻结输出合同,SIMD/CUDA 共记录 972 次完整张量诊断;首次超时与后续补齐分别保留。全量质量参考暴露并推动修复了 tokenizer 的 added-token 边界缺陷,修复后另通过 267 条独立分词参考、137 项输入契约和受影响案例三后端真实回归。内部层诊断仍缺独立上游张量及冻结阈值;新 tokenizer 实现的 AOT 尚未重测。各构建的数值、质量和性能证据按程序集哈希分别记录。

本轮性能工具验证在普通 .NET 10.0.11 / i9-13900HX / RTX4070 Laptop 下记录:CUDA long-32的end_to_end单样本 38.319秒,独立分项明确未测;SIMD long-1为 42.183秒。据当前单题耗时估算CPU long-32的discovery与正式两遍约45分钟,超过工具30分钟总上限,本轮未启动该格。受控CUDA截止测试正确保留3次进入、2次完成、0正式样本及资源回收证据。历史九格画像和CPU 300秒失败继续保留;这些数据不构成稳定尾延迟、新AOT性能或优化收益声明。

独立使用

Sezika 可以独立加载固定模型包并执行决策。先按独立使用说明准备并验证模型资产;在仓库根目录执行:

dotnet build Sezika.slnx -c Release
dotnet run --project src/Sezika.Cli -c Release --no-build -- inspect --model .artifacts/models/laya-mmbert
dotnet run --project src/Sezika.Cli -c Release --no-build -- predict --model .artifacts/models/laya-mmbert --input samples/requests/decision.zh.json --deadline-seconds 300

predict 使用 CPU 返回 Choice、Score、Boolean 的 JSON 答案;中文与英文请求均可直接修改。inspect 是固定资产预检查,完整张量配置仍在加载时验证。C# 宿主可以使用 DecisionModelRuntime.Load(...) 和 Evaluate(...) 复用同一 session;API 示例和输出语义见独立使用说明。当前结果为 uncalibrated;开发期 CLI 尚未正式发布。

决策原语

原语语义输出
Choice从请求给定的有限候选中选择选中项、完整概率分布、集中度
Score按有序 rubric 评分概率加权期望、各级概率、等级说明
Boolean判断命题成立的可能性P(true);外部兼容层可映射为 noul

适用方向包括意图识别、模型/工具路由、RAG 候选重排、内容判断和结果核验。决策引擎返回建议,由调用方控制动作与权限;开放式回复由生成模型承担。

技术边界

  • 首个候选架构采用 mmBERT-base 类多语言 encoder 加类型化决策头。权重、tokenizer 和训练数据逐项审核许可,独立于引擎代码发布。
  • 基础推理使用 C# 实现算子,不依赖 Python、PyTorch、ONNX Runtime、cuBLAS/cuDNN 或另一服务进程。开发阶段可使用固定参考实现生成数值对照数据。
  • GPU 已通过 NVIDIA CUDA Driver 路径:C# kernels 在构建期由 ILGPU 1.5.3 导出 PTX/ABI,Native AOT 通过静态 Driver 绑定执行完整 encoder/head;不使用 cuBLAS/cuDNN。
  • 类库静态纳入宿主;使用 source-generated JSON,保持 Native AOT/trimming 可分析性。
  • 模型资产、context、问题/候选数量、并发、工作空间和取消均有明确边界。
  • 多语言能力逐语言评测;概率、分布集中度、校准有效范围与拒答分别表达。

文档与工程

  • 独立使用:固定模型准备、CLI、C# 调用和决策输入输出。
  • 参考项目分析:Laya 的可审计模型实现,以及 TypeSafe Jev 的公开协议与边界。
  • 下一阶段研究:Sezika、Laya、Jev、Nimble 的路线比较,CPU/CUDA 优化、双模型训练与 IoTSharp 集成计划。
  • 修正路径质量证据:完整题集的真实模型结果、有限独立参考和可核查的 forward 证据;旧输入报告单独保留。
  • Laya oracle 合同、C# 真实捕获与数值对照证据:固定源码/资产/输入/容差,保留完整清单差异和支持范围的 token、marker、logits 验收结果。
  • 数据隔离审计:来源、许可、用途、家族/实体/近重复与封存声明检查;示例不代表获准训练的数据集。
  • 长输入性能画像:当前渲染路径的真实短/中/长与 1/8/32 问请求,实际输入、端到端耗时、分项与资源证据;工具说明列出复现方法和计时口径。
  • 架构设计:推理路径、模型资产、契约、校准与资源约束。
  • 纯 C# GPU 与 Native AOT:ILGPU 编译期边界、CUDA Driver 路径及最小验证关口。
  • S5 性能与 AOT 证据:Windows 四后端基准、Ubuntu WSL2 真实模型 AOT smoke、计时与内存边界。
  • 阶段路线图:实现顺序、验收条件与工作量判断。
  • 闭环审计:逐阶段证据、状态与剩余条件。
  • src/Sezika:.NET 10 核心类库、模型加载、tokenizer、CPU encoder 与 typed decision engine。
  • English

真实模型、CUDA 与 AOT 命令及实测结果见 阶段证据 和 GPU/AOT 设计。旧输入实现的首轮 PAWS 结果低于多数类基线;修正后本固定集为 68%,但已查看题集不能用于选参或冒充新封存测试。多语言质量、裸机 Linux 性能和更充分的尾延迟采样仍需独立证据。

开源许可

自有代码使用 Apache License 2.0。研究参考与第三方资产边界见 THIRD_PARTY_NOTICES.md。本项目不声称复现 Jev 的闭源模型,也不继承上游的速度或质量结论。