作物監視は精密農業に不可欠ですが、現在のシステムは高レベルの推論を欠いています。私たちは、視覚言語モデル(VLM)を使用してロボットタスク計画をガイドする新しいモジュラーフレームワークを紹介します。このフレームワークは、豊富なRGBカメラフィードや2Dセマンティック占有マップなどの異種データソースを積極的に照会し、ロボティックアクションプリミティブと交互に使います。私たちは、単文化と複文化環境における短期および長期の作物監視タスクに対する包括的なベンチマークを提供します。結果として、ゼロショットVLMは短期タスクで87%の成功率を達成し、人間の専門家と同等ですが、複雑な長期・多目標タスクでは成功率が10%未満に大幅に低下します。この低下にもかかわらず、タスク完了率は無音条件下で76%を超えています。重要なのは、システムがノイズの多いセマンティックマップに依存すると劣化することで、持続的なロボティックオペレーションのための現在のVLMコンテキストグラウンディングの主要な制限を示しています。この研究は、展開可能なフレームワークと、複雑な農業ロボティクスのためのVLMの能力と欠点に関する重要な洞察を提供します。補足資料: https://kendallkoe.com/Visual-Language-Guided-Task-Planning-for-Horticultural-Robots/.
Cuaran et al. (Sat,) はこの問題を研究した。