Benchmark and research framework examining whether language models knowingly express beliefs that differ from their internal representations.
- Jan 1, 2024
- —
- —
- —
- —
- 1
Releases
Feb 11, 2025MASK belief-alignment benchmark releasedBenchmark result
Scale published MASK as part of its safety research program for testing whether models knowingly state beliefs inconsistent with their internal representations.

