Key points are not available for this paper at this time.
Avec le développement des modèles de langage à grande échelle (LLM), le fine-tuning des LLM pré-entraînés est devenu un paradigme courant pour résoudre des tâches en aval du traitement du langage naturel. Cependant, former un modèle de langage dans le domaine juridique nécessite un grand nombre de documents juridiques afin que le modèle de langage puisse apprendre la terminologie juridique et la particularité du format des documents juridiques. Les approches NLP typiques reposent généralement sur de nombreux ensembles de données annotées manuellement pour l'entraînement. Toutefois, dans l'application au domaine juridique, il est difficile d'obtenir un grand nombre d'ensembles de données annotées manuellement, ce qui limite la méthode typique appliquée à la tâche de rédaction de documents juridiques. Les résultats expérimentaux de cet article montrent que nous pouvons non seulement tirer parti d'un grand nombre de documents juridiques sans annotation et sans segmentation de mots chinois pour un fine-tuning d'un modèle de langage à grande échelle, mais plus important encore, qu'il peut affiner un LLM pré-entraîné sur un ordinateur local pour accomplir la tâche de génération de brouillons de documents juridiques, tout en protégeant la confidentialité des informations et en améliorant les questions de sécurité de l'information.
Lin et al. (Jeu,) ont étudié cette question.