What is transfer learning in Natural Language Processing, and how does it leverage pre-trained models for new tasks? How does transfer learning reduce the need for large labeled datasets? What are some common pre-trained models used in NLP? In which scenarios is transfer learning most beneficial? What are the advantages and limitations of using transfer learning in NLP applications?