Key points are not available for this paper at this time.
本研究は、特にGPT-4を対象に、大規模言語モデル(LLM)の翻訳品質を、さまざまな専門性レベルを持つ人間翻訳者と複数の言語ペアおよび分野にわたって包括的に評価します。慎重に設計された注釈ラウンドを通じて、私たちはGPT-4が総エラー数においてジュニア翻訳者と同等のパフォーマンスを発揮するが、中級および上級翻訳者には劣ることを発見しました。また、異なる言語および分野におけるパフォーマンスの不均衡も観察され、リソースが豊富な方向から貧弱な方向への翻訳能力が徐々に弱まることがわかりました。さらに、GPT-4と人間翻訳者によって提供された翻訳を質的に研究し、GPT-4翻訳者は直訳の問題を抱えており、人間翻訳者は時折背景情報を過剰に考慮してしまうことがわかりました。私たちの知識では、本研究はLLMを人間翻訳者と対比して評価し、その出力の体系的な違いを分析する初めての研究であり、LLMに基づく翻訳の現状とその潜在的な限界に関する貴重な洞察を提供します。
Yan et al. (2024) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: