Multilingual, non-autoregressive System 1 decision engine in C# and .NET 10. Native AOT and C# GPU kernels via device drivers.
C#
5
21 commits
updated Oct 4, 2026
Multilingual, non-autoregressive System 1 decision engine.
Sezika 面向本地软件中的语义判断,目标是使用 C#、.NET 10 与 Native AOT,把文本或结构化状态转换为类型化决策与概率分布。模型、CPU/GPU 算子及调度以 C# 实现,GPU 运行时允许调用系统显卡驱动。
文本 / JSON 状态 + 类型化问题 + 候选标准
↓
多语言编码器 → 决策头 → 概率分布(当前未校准)
↓
Choice / Score / Boolean
↓
调用方判断、拒答或转入生成模型
当前仓库包含可运行的纯 C# scalar/SIMD FP32 与 W8A32 encoder/head、固定真实 Laya/mmBERT 开发资产的安全加载、Choice/Score/Boolean typed decision、tokenizer oracle、校准评估器,以及 ILGPU 构建期 PTX/ABI 和 CUDA Driver 完整推理路径。S5-04/S5-05 已完成:Windows win-x64 Native AOT 四后端各覆盖 1/8/32 问、每项 5 次正式采样;Ubuntu WSL2 linux-x64 四后端通过真实模型 Native AOT smoke,各为 3 问、1 次采样。WSL smoke 不代表裸机 Linux 性能;逐语言质量仍未验收,模型权重不随仓库发布。 具体范围见 S5 性能与 AOT 证据及原始报告。
2026-09-30 已完成独立 jhu-clsp/mmBERT-base 原始权重/tokenizer 的固定 hash 核验、纯 C# 受限转换、decision-v1 输入和独立 encoder CPU smoke;项目自有中英三题型 head 仅完成 12 条 train/development 开发 smoke。该独立资产尚未替换默认 Laya 路径,也没有通过上游逐层数值、许可发布、校准、封存质量或 CUDA/AOT 门槛;证据见 S4 独立模型报告。
当前 W8A32 路径慢于 SIMD,且在保留 FP32 原权重之外增加量化缓存,没有降低总驻留内存。数值对齐、真实推理、AOT 与语言质量分别验收,不将量化实现视为已经取得性能或内存收益。
2026-09-25 已完成固定 Laya 的 46 条真实 oracle 捕获,并修正题型前缀、候选渲染/顺序、JSON 文本和 256 前缀 / 1024 总长度语义。SIMD 与 CUDA 各在 38 条支持范围内的回答上通过冻结数值容差,4 条非法输入的失败语义一致;另 4 条候选数量合同差异明确保留,不能声称全上游合同通过。请求默认严格拒绝截断,显式 length_policy: "laya_compatible" 才采用兼容截断并返回诊断。详见输入合同与真实数值证据。
2026-09-25 solution 构建为 0 警告/0 错误,输入与运行时、资源、CUDA 诊断分别通过 137/35/43 项检查;数据隔离与性能画像工具已同步到该次构建。2026-09-26 又完成修正路径的两 RID Native AOT 长输入回归:win-x64 / Ubuntu WSL2 linux-x64 的输入契约各138项通过,SIMD/CUDA各38条真实回答+4条非法拒绝通过冻结合同,scalar各3条长输入通过;4条候选数量差异继续保留。修正后的质量和性能仍分别验收,旧报告继续限定于原有输入实现。执行依赖与剩余门槛见 路线图。
Scalar 另完成三题型×中英×短中长的 18 条核心数值对照。token 覆盖率重测显示 PAWS 在 strict/compatible 下均为 250/250,Nimble 为 strict 306/324、compatible 324/324;这些是输入可构造率,不是推理成功率或答案正确率。
2026-09-26 的本轮质量复测已把独立 Laya 与 C# CUDA 逐题数值比较扩展到 PAWS 250 + Nimble 324,共574/574条通过。全量参考发现并推动修复了 tokenizer 的 added-token 边界问题;修复后同一构建重新捕获全部题目,两实现分别答对 170/250(68.00%) 和 137/324(42.28%),本轮均使用 laya_compatible。另12条原创中英fixture全部通过数值对比,双方8/12正确;该小型公开样本不构成语言质量验收。Nimble Boolean负类召回仍仅1/57,概率未校准,外部题集语言仍记 unspecified。
此前构建的Nimble strict实测处理全324题:306题实际推理,133题正确,已答准确率43.46%,按全部处理题计为41.05%;18题在forward前因需要截断而拒绝。该历史报告保留原程序身份,不与本轮tokenizer修复后的compatible结果混合。
本轮分层诊断已补齐三题型×中英×短中长 18 组、54 个三后端输出,全部满足冻结输出合同,SIMD/CUDA 共记录 972 次完整张量诊断;首次超时与后续补齐分别保留。全量质量参考暴露并推动修复了 tokenizer 的 added-token 边界缺陷,修复后另通过 267 条独立分词参考、137 项输入契约和受影响案例三后端真实回归。内部层诊断仍缺独立上游张量及冻结阈值;新 tokenizer 实现的 AOT 尚未重测。各构建的数值、质量和性能证据按程序集哈希分别记录。
本轮性能工具验证在普通 .NET 10.0.11 / i9-13900HX / RTX4070 Laptop 下记录:CUDA long-32的end_to_end单样本 38.319秒,独立分项明确未测;SIMD long-1为 42.183秒。据当前单题耗时估算CPU long-32的discovery与正式两遍约45分钟,超过工具30分钟总上限,本轮未启动该格。受控CUDA截止测试正确保留3次进入、2次完成、0正式样本及资源回收证据。历史九格画像和CPU 300秒失败继续保留;这些数据不构成稳定尾延迟、新AOT性能或优化收益声明。
Sezika 可以独立加载固定模型包并执行决策。先按独立使用说明准备并验证模型资产;在仓库根目录执行:
dotnet build Sezika.slnx -c Release
dotnet run --project src/Sezika.Cli -c Release --no-build -- inspect --model .artifacts/models/laya-mmbert
dotnet run --project src/Sezika.Cli -c Release --no-build -- predict --model .artifacts/models/laya-mmbert --input samples/requests/decision.zh.json --deadline-seconds 300
predict 使用 CPU 返回 Choice、Score、Boolean 的 JSON 答案;中文与英文请求均可直接修改。inspect 是固定资产预检查,完整张量配置仍在加载时验证。C# 宿主可以使用 DecisionModelRuntime.Load(...) 和 Evaluate(...) 复用同一 session;API 示例和输出语义见独立使用说明。当前结果为 uncalibrated;开发期 CLI 尚未正式发布。
| 原语 | 语义 | 输出 |
|---|---|---|
| Choice | 从请求给定的有限候选中选择 | 选中项、完整概率分布、集中度 |
| Score | 按有序 rubric 评分 | 概率加权期望、各级概率、等级说明 |
| Boolean | 判断命题成立的可能性 | P(true);外部兼容层可映射为 noul |
适用方向包括意图识别、模型/工具路由、RAG 候选重排、内容判断和结果核验。决策引擎返回建议,由调用方控制动作与权限;开放式回复由生成模型承担。
src/Sezika:.NET 10 核心类库、模型加载、tokenizer、CPU encoder 与 typed decision engine。真实模型、CUDA 与 AOT 命令及实测结果见 阶段证据 和 GPU/AOT 设计。旧输入实现的首轮 PAWS 结果低于多数类基线;修正后本固定集为 68%,但已查看题集不能用于选参或冒充新封存测试。多语言质量、裸机 Linux 性能和更充分的尾延迟采样仍需独立证据。
自有代码使用 Apache License 2.0。研究参考与第三方资产边界见 THIRD_PARTY_NOTICES.md。本项目不声称复现 Jev 的闭源模型,也不继承上游的速度或质量结论。
Multilingual, non-autoregressive System 1 decision engine in C# and .NET 10. Native AOT and C# GPU kernels via device drivers.
C#
5
21 commits
updated Oct 4, 2026
Multilingual, non-autoregressive System 1 decision engine.
Sezika 面向本地软件中的语义判断,目标是使用 C#、.NET 10 与 Native AOT,把文本或结构化状态转换为类型化决策与概率分布。模型、CPU/GPU 算子及调度以 C# 实现,GPU 运行时允许调用系统显卡驱动。
文本 / JSON 状态 + 类型化问题 + 候选标准
↓
多语言编码器 → 决策头 → 概率分布(当前未校准)
↓
Choice / Score / Boolean
↓
调用方判断、拒答或转入生成模型
当前仓库包含可运行的纯 C# scalar/SIMD FP32 与 W8A32 encoder/head、固定真实 Laya/mmBERT 开发资产的安全加载、Choice/Score/Boolean typed decision、tokenizer oracle、校准评估器,以及 ILGPU 构建期 PTX/ABI 和 CUDA Driver 完整推理路径。S5-04/S5-05 已完成:Windows win-x64 Native AOT 四后端各覆盖 1/8/32 问、每项 5 次正式采样;Ubuntu WSL2 linux-x64 四后端通过真实模型 Native AOT smoke,各为 3 问、1 次采样。WSL smoke 不代表裸机 Linux 性能;逐语言质量仍未验收,模型权重不随仓库发布。 具体范围见 S5 性能与 AOT 证据及原始报告。
2026-09-30 已完成独立 jhu-clsp/mmBERT-base 原始权重/tokenizer 的固定 hash 核验、纯 C# 受限转换、decision-v1 输入和独立 encoder CPU smoke;项目自有中英三题型 head 仅完成 12 条 train/development 开发 smoke。该独立资产尚未替换默认 Laya 路径,也没有通过上游逐层数值、许可发布、校准、封存质量或 CUDA/AOT 门槛;证据见 S4 独立模型报告。
当前 W8A32 路径慢于 SIMD,且在保留 FP32 原权重之外增加量化缓存,没有降低总驻留内存。数值对齐、真实推理、AOT 与语言质量分别验收,不将量化实现视为已经取得性能或内存收益。
2026-09-25 已完成固定 Laya 的 46 条真实 oracle 捕获,并修正题型前缀、候选渲染/顺序、JSON 文本和 256 前缀 / 1024 总长度语义。SIMD 与 CUDA 各在 38 条支持范围内的回答上通过冻结数值容差,4 条非法输入的失败语义一致;另 4 条候选数量合同差异明确保留,不能声称全上游合同通过。请求默认严格拒绝截断,显式 length_policy: "laya_compatible" 才采用兼容截断并返回诊断。详见输入合同与真实数值证据。
2026-09-25 solution 构建为 0 警告/0 错误,输入与运行时、资源、CUDA 诊断分别通过 137/35/43 项检查;数据隔离与性能画像工具已同步到该次构建。2026-09-26 又完成修正路径的两 RID Native AOT 长输入回归:win-x64 / Ubuntu WSL2 linux-x64 的输入契约各138项通过,SIMD/CUDA各38条真实回答+4条非法拒绝通过冻结合同,scalar各3条长输入通过;4条候选数量差异继续保留。修正后的质量和性能仍分别验收,旧报告继续限定于原有输入实现。执行依赖与剩余门槛见 路线图。
Scalar 另完成三题型×中英×短中长的 18 条核心数值对照。token 覆盖率重测显示 PAWS 在 strict/compatible 下均为 250/250,Nimble 为 strict 306/324、compatible 324/324;这些是输入可构造率,不是推理成功率或答案正确率。
2026-09-26 的本轮质量复测已把独立 Laya 与 C# CUDA 逐题数值比较扩展到 PAWS 250 + Nimble 324,共574/574条通过。全量参考发现并推动修复了 tokenizer 的 added-token 边界问题;修复后同一构建重新捕获全部题目,两实现分别答对 170/250(68.00%) 和 137/324(42.28%),本轮均使用 laya_compatible。另12条原创中英fixture全部通过数值对比,双方8/12正确;该小型公开样本不构成语言质量验收。Nimble Boolean负类召回仍仅1/57,概率未校准,外部题集语言仍记 unspecified。
此前构建的Nimble strict实测处理全324题:306题实际推理,133题正确,已答准确率43.46%,按全部处理题计为41.05%;18题在forward前因需要截断而拒绝。该历史报告保留原程序身份,不与本轮tokenizer修复后的compatible结果混合。
本轮分层诊断已补齐三题型×中英×短中长 18 组、54 个三后端输出,全部满足冻结输出合同,SIMD/CUDA 共记录 972 次完整张量诊断;首次超时与后续补齐分别保留。全量质量参考暴露并推动修复了 tokenizer 的 added-token 边界缺陷,修复后另通过 267 条独立分词参考、137 项输入契约和受影响案例三后端真实回归。内部层诊断仍缺独立上游张量及冻结阈值;新 tokenizer 实现的 AOT 尚未重测。各构建的数值、质量和性能证据按程序集哈希分别记录。
本轮性能工具验证在普通 .NET 10.0.11 / i9-13900HX / RTX4070 Laptop 下记录:CUDA long-32的end_to_end单样本 38.319秒,独立分项明确未测;SIMD long-1为 42.183秒。据当前单题耗时估算CPU long-32的discovery与正式两遍约45分钟,超过工具30分钟总上限,本轮未启动该格。受控CUDA截止测试正确保留3次进入、2次完成、0正式样本及资源回收证据。历史九格画像和CPU 300秒失败继续保留;这些数据不构成稳定尾延迟、新AOT性能或优化收益声明。
Sezika 可以独立加载固定模型包并执行决策。先按独立使用说明准备并验证模型资产;在仓库根目录执行:
dotnet build Sezika.slnx -c Release
dotnet run --project src/Sezika.Cli -c Release --no-build -- inspect --model .artifacts/models/laya-mmbert
dotnet run --project src/Sezika.Cli -c Release --no-build -- predict --model .artifacts/models/laya-mmbert --input samples/requests/decision.zh.json --deadline-seconds 300
predict 使用 CPU 返回 Choice、Score、Boolean 的 JSON 答案;中文与英文请求均可直接修改。inspect 是固定资产预检查,完整张量配置仍在加载时验证。C# 宿主可以使用 DecisionModelRuntime.Load(...) 和 Evaluate(...) 复用同一 session;API 示例和输出语义见独立使用说明。当前结果为 uncalibrated;开发期 CLI 尚未正式发布。
| 原语 | 语义 | 输出 |
|---|---|---|
| Choice | 从请求给定的有限候选中选择 | 选中项、完整概率分布、集中度 |
| Score | 按有序 rubric 评分 | 概率加权期望、各级概率、等级说明 |
| Boolean | 判断命题成立的可能性 | P(true);外部兼容层可映射为 noul |
适用方向包括意图识别、模型/工具路由、RAG 候选重排、内容判断和结果核验。决策引擎返回建议,由调用方控制动作与权限;开放式回复由生成模型承担。
src/Sezika:.NET 10 核心类库、模型加载、tokenizer、CPU encoder 与 typed decision engine。真实模型、CUDA 与 AOT 命令及实测结果见 阶段证据 和 GPU/AOT 设计。旧输入实现的首轮 PAWS 结果低于多数类基线;修正后本固定集为 68%,但已查看题集不能用于选参或冒充新封存测试。多语言质量、裸机 Linux 性能和更充分的尾延迟采样仍需独立证据。
自有代码使用 Apache License 2.0。研究参考与第三方资产边界见 THIRD_PARTY_NOTICES.md。本项目不声称复现 Jev 的闭源模型,也不继承上游的速度或质量结论。