Models created for experiments in "First-Order Steering: Translating Weight Adaptation into Activation Steering"
Chapman Alignment Faking
classroom
AI & ML interests
None defined yet.
Recent Activity
models 8
ChapAF/intent-0.1-0.5b
0.5B • Updated
ChapAF/herd-mistral-7b-instruct-v0-3-layer-11
Updated
ChapAF/herd-mistral-7b-instruct-v0-3-all-layers
Updated
ChapAF/herd-gemma-4-e2b-layer-34
Updated
ChapAF/herd-gemma-4-e2b-all-layers
Updated
ChapAF/herd-qwen2-5-vl-3b-layer-15
Updated
ChapAF/herd-qwen2-5-vl-3b-layer-13
Updated
ChapAF/herd-qwen2-5-vl-3b-all-layers
Updated
datasets 6
ChapAF/analogy-dataset
Viewer • Updated • 10k • 20
ChapAF/bulletpointer-dataset
Viewer • Updated • 10k • 32
ChapAF/impoliteness-dataset
Viewer • Updated • 47k • 83
ChapAF/sophisticated-language-dataset
Viewer • Updated • 10k • 34
ChapAF/system-prompt-dataset
Viewer • Updated • 16k • 18
ChapAF/whitebox-harmful-ultrachat
Viewer • Updated • 341k • 34