DeKodez/ai-disclaimer-triggers
Viewer • Updated • 61 • 9
An experimental model with reduced "As an AI language model..." hedging behavior.
This model has been abliterated to reduce the reflexive AI disclaimer responses (e.g., "As an AI language model, I don't have personal beliefs...") when asked opinion-seeking questions.
This is an experiment - the abliteration is partial and some disclaimers remain.
| Metric | Original | Abliterated |
|---|---|---|
| AI Disclaimer Rate | 61/61 (100%) | 35/61 (57.4%) |
42.6% reduction in AI disclaimers on test prompts.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("DeKodez/Qwen2.5-1.5B-Instruct-no-disclaimer")
tokenizer = AutoTokenizer.from_pretrained("DeKodez/Qwen2.5-1.5B-Instruct-no-disclaimer")
Experimental research model. Results are partial. Use at your own discretion.