are long yaps (monologues) overrepresented or underrepresented in llm training data vs human training data?