Multimodale Mensch-Roboter-Interaktion unter Verwendung der Mensch-Pose-Schätzung und lokalen großen Sprachmodellen | Synapse