P1(0.5B λ=0.5):+17.9%;P3 参数扫描后 1.0995×裸;P4/P5 熵 1.545~2.034(健康区间 >0.6)。
判定线:熵 ≥ 裸 × 0.95,否则判"退化"。
裸 0.13 → P3 0.0787 → P4 0.005 → P5 ≤0.019;P2.5 乘性重加权重复率 0。
判定线:重复率 − 裸 ≤ +0.05 且 <0.3。
P3 +3.0pp(0.0979→0.1279);P1 E9 命中 0.40;P4 0.154;P5 0.141。
判定线:≥ 裸 即正增益。
| 基准 | 指标 | 判定线 | 实测(P3 锚点 / P2.5 潮汐) | 判定 |
|---|---|---|---|---|
| LLM-Judge | win_rate(60 配对盲评) | ≥ 裸×1.25 | P3 单模式 +12.5%(未过);+人设 +56.25%(过);P2.5 混合 +91%(过) | P2.5 ✓ / P3+人设 ✓ |
| HeartBench | overall(0–100) | 正提升 | P3:35.90 → 43.69(+21.7%) | ✓ |
| TuringBench | human_likeness | 正提升 | P3:0.2333 → 0.7000(+200%) | ✓ |
| EmoCharacter | fidelity / 一致性识别 | fidelity ≥ 裸−5% | P2.5 一致性 0.6→0.8(+33%);P3 fidelity 不劣化、识别率受模板天花板 | P2.5 ✓ / P3 △ |
| HEART-BENCH | 共情 / 一致性 / 决策率 | 不退化 + 决策率 100% | P3 一致性 +8.3%、共情 -5.26%(边缘)、决策率 100% | ✓(边缘) |
| 工程指标 | 熵 / 重复 / 命中 / 显存 / 延迟 | 熵≥裸×0.95、重复≤裸+0.05 | P3 熵 1.0995×、重复 -0.055、延迟 -0.7% | ✓ |
所有对照同种子、同提示词、同温度,唯一变量 = 引擎开关;CODA 全因子 164/164 一致;P2.5 20 样本与 30 样本结论一致(非运气)。
| 模式 | 种子 42 | 种子 200 | 结论 |
|---|---|---|---|
| 锚点 P3 win_rate | 0.2333 | 0.1167 | 差 1.6 倍 → 需多种子平均 |
工程建议:正式验收用 3~5 种子取平均,单种子只作方向参考。
100/100 成功、峰值显存 6378MB(<14GB)、泄漏 +0MB、延迟 14.38s/轮 → 可产品化;长上下文 2048 前 256 token 正常、512+ 坍缩(已知边界,λ 需随步数衰减)。
7B 裁判 5 次重评标准差 0.0(稳定);但风格偏好存在(偏爱"心理建议式"回复)——双裁判(本地 7B + 云 pro)交叉验证方向一致,非单一裁判偏差。
| 模型 | fp16 熵提升 | 4bit 熵提升 | 4bit 判定 |
|---|---|---|---|
| Qwen2.5-0.5B | +27% | -2% | 回响偏强(λ 需 ×0.75) |
| Qwen2.5-1.5B | +42% | +28% | 有效 |
| Qwen2.5-3B | +45% | +43% | 有效 |
| Qwen2.5-7B | — | +45% | 最稳定(重复 0.029) |
| Qwen3-1.7B | -66% | -73% | 坍缩 → 架构族因子 0.3 修复 |
| Qwen3-4B | +51% | +56% | 有效(因子 0.6 后重复 0.06) |
| 你的约束 | 推荐方案 | 一句话理由 |
|---|---|---|
| 要最高盲评胜率(本地,Qwen2.5 系) | P2.5 潮汐回响混合 v4.2 | LLM-Judge +91%、重复率 0、AI 腔抑制内置 |
| 要工程最稳、显存最小、可上闭源 API | P3 锚点回响 | 3.6MB、零 hook、三级降级、五基准覆盖最全 |
| 要全场最高 win_rate(融合) | P3 + P4 双通道 | 0.2667 全场最高,既"看得见"又"说得出" |
| 要第五空间 / 注意力级增强 | P4 KV 情感共振 | KV 调制,softmax 天然有界 |
| 要多模型即插即用不调参 | P1.5 通用兼容层 | 19 配置自动适配,未注册兜底 ≥ 已注册 |
| 要一体化全合成(战略级) | P5 超融合 UFD | P1×P2×P3×P4 机制级融合,无坍缩 |