[ 
https://issues.apache.org/jira/browse/MESOS-2605?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=14494989#comment-14494989
 ] 

Michael Park commented on MESOS-2605:
-------------------------------------

Reporting recent findings.

{code:title=master}
Apr 14 18:49:40 ip-10-168-90-31.ec2.internal mesos-master[1226]: W0414 
18:49:40.078554  1248 master.cpp:4015] Executor 
executor.journalnode.NodeExecutor.1429034850690 of framework 
20150408-055737-526034954-5050-1226-0393 possibly unknown to the slave 
20150408-055737-526034954-5050-1226-S9 at slave(1)@10.154.8.101:5051 
(ec2-54-237-83-163.compute-1.amazonaws.com)
{code}

{code:title=slave}
Apr 14 18:49:36 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:36.802649 18193 slave.cpp:4305] Recovering executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
20150408-055737-526034954-5050-1226-0393
/* ... */
Apr 14 18:49:36 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:36.832767 18188 status_update_manager.cpp:205] Recovering executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
20150408-055737-526034954-5050-1226-0393
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:36.857517 18189 docker.cpp:470] Recovering container 
'5338e6cf-03ac-4882-a08e-48bfd6d797dc' for executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
20150408-055737-526034954-5050-1226-0393
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:36.870594 18190 containerizer.cpp:350] Recovering container 
'5338e6cf-03ac-4882-a08e-48bfd6d797dc' for executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
20150408-055737-526034954-5050-1226-0393
{code}

So we somehow we're calling {{recover}} in {{docker.cpp}} as well as 
{{containerizer.cpp}}. But based on the fact that HDFS doesn't use {{docker}} 
at all, along with this log:

{code}
Apr 14 18:07:30 ip-10-154-8-101.ec2.internal mesos-slave[11172]: I0414 
18:07:30.708111 11187 containerizer.cpp:472] Starting container 
'5338e6cf-03ac-4882-a08e-48bfd6d797dc' for executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
'20150408-055737-526034954-5050-1226-0393'
{code}

We should only be calling it for {{containerizer.cpp}} only.

The slave proceeds to log the following sequence of events, which shows that we 
try to docker recover the containers and when we can't find them, we terminate 
the executor.

{code}
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:37.602605 18186 slave.cpp:3738] Sending reconnect request to executor 
executor.journalnode.NodeExecutor.1429034850690 of framework 
20150408-055737-526034954-5050-1226-0393 at executor(1)@10.154.8.101:60097
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:37.611616 18186 slave.cpp:2321] Re-registering executor 
executor.journalnode.NodeExecutor.1429034850690 of framework 
20150408-055737-526034954-5050-1226-0393
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: E0414 
18:49:37.862635 18190 slave.cpp:2456] Failed to update resources for container 
5338e6cf-03ac-4882-a08e-48bfd6d797dc of executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
20150408-055737-526034954-5050-1226-0393, destroying container: Failed to 
'docker inspect mesos-5338e6cf-03ac-4882-a08e-48bfd6d797dc': exit status = 
exited with status 1 stderr = Error: No such image or container: 
mesos-5338e6cf-03ac-4882-a08e-48bfd6d797dc
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: E0414 
18:49:37.976002 18187 slave.cpp:3191] Termination of executor 
'executor.journalnode.NodeExecutor.1429034850690' of framework 
'20150408-055737-526034954-5050-1226-0393' failed: Failed to kill the Docker 
container: Failed to 'docker stop -t 0 
mesos-5338e6cf-03ac-4882-a08e-48bfd6d797dc': exit status = exited with status 1 
stderr = Error response from daemon: No such container: 
mesos-5338e6cf-03ac-4882-a08e-48bfd6d797dc
/* ... */
Apr 14 18:49:37 ip-10-154-8-101.ec2.internal mesos-slave[18180]: E0414 
18:49:37.977609 18187 slave.cpp:2653] Failed to update resources for container 
5338e6cf-03ac-4882-a08e-48bfd6d797dc of executor 
executor.journalnode.NodeExecutor.1429034850690 running task 
task.journalnode.journalnode.NodeExecutor.1429034850690 on status update for 
terminal task, destroying container: Container 
'5338e6cf-03ac-4882-a08e-48bfd6d797dc' not found
/* ... */
Apr 14 18:49:40 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:40.079958 18188 slave.cpp:949] MPARK: Slave::doReliableRegistration
Apr 14 18:49:40 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:40.080099 18188 slave.cpp:1053] MPARK: Executor 
'executor.namenode.NameNodeExecutor.1429034908782' is terminated!
Apr 14 18:49:40 ip-10-154-8-101.ec2.internal mesos-slave[18180]: I0414 
18:49:40.080118 18188 slave.cpp:1053] MPARK: Executor 
'executor.journalnode.NodeExecutor.1429034850690' is terminated!
{code}

> The slave sometimes does not send active executors during reregistration
> ------------------------------------------------------------------------
>
>                 Key: MESOS-2605
>                 URL: https://issues.apache.org/jira/browse/MESOS-2605
>             Project: Mesos
>          Issue Type: Bug
>    Affects Versions: 0.22.0
>            Reporter: Elizabeth Lingg
>            Assignee: Michael Park
>              Labels: mesosphere
>
> The slave sometimes does not send active executors during reregistration. 
> Framework checkpointing is enabled, and the executor successfully 
> reregisters. However, the tasks in that executor are LOST (by abnormal 
> executor termination) because the executor is removed by the mesos master as 
> unknown. See the example below, 
> task.journalnode.journalnode.NodeExecutor.1428609184051.
> See the Slave Logs here for the Task:
> {code}
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.778790 25126 status_update_manager.cpp:317] Received status update 
> TASK_RUNNING (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.779013 25126 status_update_manager.hpp:346] Checkpointing UPDATE for 
> status update TASK_RUNNING (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for 
> task task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.781788 25123 slave.cpp:2753] Forwarding the update TASK_RUNNING 
> (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008 to [email protected]:5050
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.781889 25123 slave.cpp:2686] Sending acknowledgement for status 
> update TASK_RUNNING (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008 to executor(1)@10.168.119.78:47638
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.784503 25124 status_update_manager.cpp:389] Received status update 
> acknowledgement (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008
> Apr 09 19:53:06 ip-10-168-119-78.ec2.internal mesos-slave[25116]: I0409 
> 19:53:06.784567 25124 status_update_manager.hpp:346] Checkpointing ACK for 
> status update TASK_RUNNING (UUID: 4eb22075-c319-463d-8f70-94db9caa69c6) for 
> task task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008
> {code}
> Master Logs:
> {code}
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: W0409 
> 20:19:43.008666  1067 master.cpp:4015] Executor 
> executor.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008 possibly unknown to the slave 
> 20150407-233647-2059219722-5050-1659-S5 at slave(1)@10.168.119.78:5051 
> (ec2-54-237-57-237.compute-1.amazonaws.com)
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: I0409 
> 20:19:43.008652  1074 hierarchical.hpp:648] Recovered cpus(*):0.1; 
> mem(*):1536 (total allocatable: cpus(*):3.5; mem(*):21113; disk(*):142210; 
> ports(*):[3889-5044, 5046-5049, 2182-2958, 2960-3887, 1025-2180, 8082-9041, 
> 9043-9159, 9161-9999, 5052-6999, 7002-7198, 7200-8079, 10001-65535]) on slave 
> 20150407-233647-2059219722-5050-1659-S5 from framework 
> 20150408-002100-4261056010-5050-1047-0008
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: I0409 
> 20:19:43.008712  1067 master.cpp:4714] Removing executor 
> 'executor.journalnode.NodeExecutor.1428609184051' with resources cpus(*):0.1; 
> mem(*):1536 of framework 20150408-002100-4261056010-5050-1047-0008 on slave 
> 20150407-233647-2059219722-5050-1659-S5 at slave(1)@10.168.119.78:5051 
> (ec2-54-237-57-237.compute-1.amazonaws.com)
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: I0409 
> 20:19:43.010372  1067 master.cpp:3295] Status update TASK_LOST (UUID: 
> e5532567-e5b2-4fca-87aa-f3f98e371640) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008 from slave 
> 20150407-233647-2059219722-5050-1659-S5 at slave(1)@10.168.119.78:5051 
> (ec2-54-237-57-237.compute-1.amazonaws.com)
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: I0409 
> 20:19:43.013746  1067 master.cpp:3295] Status update TASK_LOST (UUID: 
> e5532567-e5b2-4fca-87aa-f3f98e371640) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008 from slave 
> 20150407-233647-2059219722-5050-1659-S5 at slave(1)@10.168.119.78:5051 
> (ec2-54-237-57-237.compute-1.amazonaws.com)
> Apr 09 20:19:43 ip-10-142-250-253.ec2.internal mesos-master[1047]: I0409 
> 20:19:43.013767  1067 master.cpp:3336] Forwarding status update TASK_LOST 
> (UUID: e5532567-e5b2-4fca-87aa-f3f98e371640) for task 
> task.journalnode.journalnode.NodeExecutor.1428609184051 of framework 
> 20150408-002100-4261056010-5050-1047-0008
> {code}



--
This message was sent by Atlassian JIRA
(v6.3.4#6332)

Reply via email to