Merge branch '14451-crunchstat-summary-cache-ram'

author Tom Morris <tfmorris@veritasgenetics.com>

Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)

committer Tom Morris <tfmorris@veritasgenetics.com>

Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)
author Tom Morris <tfmorris@veritasgenetics.com>
Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)
committer Tom Morris <tfmorris@veritasgenetics.com>
Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)
diff --git a/tools/crunchstat-summary/crunchstat_summary/summarizer.py b/tools/crunchstat-summary/crunchstat_summary/summarizer.py

index bcdc871a454ffbaab40a5cecebc5e0346c7b7f52..bf905a394606a4e9a1465979a575bf07e85e0657 100644 (file)
--- a/tools/crunchstat-summary/crunchstat_summary/summarizer.py
+++ b/tools/crunchstat-summary/crunchstat_summary/summarizer.py
@@ -22,7 +22,7 @@ from crunchstat_summary import logger
  # number of GiB. (Actual nodes tend to be sold in sizes like 8 GiB
  # that have amounts like 7.5 GiB according to the kernel.)
  AVAILABLE_RAM_RATIO = 0.95
-
+MB=2**20
  
  # Workaround datetime.datetime.strptime() thread-safety bug by calling
  # it once before starting threads.  https://bugs.python.org/issue7980
@@ -323,6 +323,7 @@ class Summarizer(object):
              yield "# "+format_string.format(self._format(val))
  
      def _recommend_gen(self):
+        # TODO recommend fixing job granularity if elapsed time is too short
          return itertools.chain(
              self._recommend_cpu(),
              self._recommend_ram(),
@@ -333,21 +334,27 @@ class Summarizer(object):
  
          constraint_key = self._map_runtime_constraint('vcpus')
          cpu_max_rate = self.stats_max['cpu']['user+sys__rate']
-        if cpu_max_rate == float('-Inf'):
+        if cpu_max_rate == float('-Inf') or cpu_max_rate == 0.0:
              logger.warning('%s: no CPU usage data', self.label)
              return
+        # TODO Don't necessarily want to recommend on isolated max peak
+        # take average CPU usage into account as well or % time at max
          used_cores = max(1, int(math.ceil(cpu_max_rate)))
          asked_cores = self.existing_constraints.get(constraint_key)
-        if asked_cores is None or used_cores < asked_cores:
+        if asked_cores is None:
+            asked_cores = 1
+        # TODO: This should be more nuanced in cases where max >> avg
+        if used_cores < asked_cores:
              yield (
                  '#!! {} max CPU usage was {}% -- '
-                'try runtime_constraints "{}":{}'
+                'try reducing runtime_constraints to "{}":{}'
              ).format(
                  self.label,
                  math.ceil(cpu_max_rate*100),
                  constraint_key,
                  int(used_cores))
  
+    # FIXME: This needs to be updated to account for current nodemanager algorithms
      def _recommend_ram(self):
          """Recommend an economical RAM constraint for this job.
  
@@ -387,20 +394,20 @@ class Summarizer(object):
          if used_bytes == float('-Inf'):
              logger.warning('%s: no memory usage data', self.label)
              return
-        used_mib = math.ceil(float(used_bytes) / 1048576)
+        used_mib = math.ceil(float(used_bytes) / MB)
          asked_mib = self.existing_constraints.get(constraint_key)
  
          nearlygibs = lambda mebibytes: mebibytes/AVAILABLE_RAM_RATIO/1024
-        if asked_mib is None or (
-                math.ceil(nearlygibs(used_mib)) < nearlygibs(asked_mib)):
+        if used_mib > 0 and (asked_mib is None or (
+                math.ceil(nearlygibs(used_mib)) < nearlygibs(asked_mib))):
              yield (
                  '#!! {} max RSS was {} MiB -- '
-                'try runtime_constraints "{}":{}'
+                'try reducing runtime_constraints to "{}":{}'
              ).format(
                  self.label,
                  int(used_mib),
                  constraint_key,
-                int(math.ceil(nearlygibs(used_mib))*AVAILABLE_RAM_RATIO*1024*(2**20)/self._runtime_constraint_mem_unit()))
+                int(math.ceil(nearlygibs(used_mib))*AVAILABLE_RAM_RATIO*1024*(MB)/self._runtime_constraint_mem_unit()))
  
      def _recommend_keep_cache(self):
          """Recommend increasing keep cache if utilization < 80%"""
@@ -409,17 +416,18 @@ class Summarizer(object):
              return
          utilization = (float(self.job_tot['blkio:0:0']['read']) /
                         float(self.job_tot['net:keep0']['rx']))
-        asked_mib = self.existing_constraints.get(constraint_key, 256)
+        # FIXME: the default on this get won't work correctly
+        asked_cache = self.existing_constraints.get(constraint_key, 256) * self._runtime_constraint_mem_unit()
  
          if utilization < 0.8:
              yield (
                  '#!! {} Keep cache utilization was {:.2f}% -- '
-                'try runtime_constraints "{}":{} (or more)'
+                'try doubling runtime_constraints to "{}":{} (or more)'
              ).format(
                  self.label,
                  utilization * 100.0,
                  constraint_key,
-                asked_mib*2*(2**20)/self._runtime_constraint_mem_unit())
+                math.ceil(asked_cache * 2 / self._runtime_constraint_mem_unit()))
  
  
      def _format(self, val):
@@ -511,7 +519,7 @@ class ProcessSummarizer(Summarizer):
  
  
  class JobSummarizer(ProcessSummarizer):
-    runtime_constraint_mem_unit = 1048576
+    runtime_constraint_mem_unit = MB
      map_runtime_constraint = {
          'keep_cache_ram': 'keep_cache_mb_per_task',
          'ram': 'min_ram_mb_per_node',
diff --git a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-arv-mount.txt.gz.report b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-arv-mount.txt.gz.report

index 5148a4523af6c8a06cdc3568da5bc4272c1d1da1..0691e4f1ef4ea7e1604a0b7b73787f25b7dd7e58 100644 (file)
--- a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-arv-mount.txt.gz.report
+++ b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-arv-mount.txt.gz.report
@@ -20,5 +20,3 @@ time  elapsed 10      -       10
  # Max network speed in a single interval: 0.00MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! container max CPU usage was 0% -- try runtime_constraints "vcpus":1
-#!! container max RSS was 0 MiB -- try runtime_constraints "ram":0
diff --git a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-crunchstat.txt.gz.report b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-crunchstat.txt.gz.report

index b61da154ffbdfd720ce2f69d1ee76e01cf2b687a..c64c34c80ec6cd775e81031330070c047265a96d 100644 (file)
--- a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-crunchstat.txt.gz.report
+++ b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-crunchstat.txt.gz.report
@@ -23,5 +23,4 @@ time  elapsed 20      -       20
  # Max network speed in a single interval: 0.00MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! container max CPU usage was 24% -- try runtime_constraints "vcpus":1
-#!! container max RSS was 67 MiB -- try runtime_constraints "ram":1020054732
+#!! container max RSS was 67 MiB -- try reducing runtime_constraints to "ram":1020054732
diff --git a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk.txt.gz.report b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk.txt.gz.report

index 9d3cd78d3f81f88239b1521c9a530b7898686e60..3075c24b951020d1444311bc083d269b581219b2 100644 (file)
--- a/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk.txt.gz.report
+++ b/tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk.txt.gz.report
@@ -34,5 +34,4 @@ time  elapsed 20      -       20
  # Max network speed in a single interval: 0.00MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! container max CPU usage was 24% -- try runtime_constraints "vcpus":1
-#!! container max RSS was 67 MiB -- try runtime_constraints "ram":1020054732
+#!! container max RSS was 67 MiB -- try reducing runtime_constraints to "ram":1020054732
diff --git a/tools/crunchstat-summary/tests/logfile_20151204190335.txt.gz.report b/tools/crunchstat-summary/tests/logfile_20151204190335.txt.gz.report

index f0a60957bba706b18b6d41288f5fc46ded754b1c..5e3ad152f7e0e48759312592344cdc936eb95f23 100644 (file)
--- a/tools/crunchstat-summary/tests/logfile_20151204190335.txt.gz.report
+++ b/tools/crunchstat-summary/tests/logfile_20151204190335.txt.gz.report
@@ -31,5 +31,4 @@ time  elapsed 80      -       80
  # Max network speed in a single interval: 42.58MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! 4xphq-8i9sb-jq0ekny1xou3zoh max CPU usage was 13% -- try runtime_constraints "min_cores_per_node":1
-#!! 4xphq-8i9sb-jq0ekny1xou3zoh max RSS was 334 MiB -- try runtime_constraints "min_ram_mb_per_node":972
+#!! 4xphq-8i9sb-jq0ekny1xou3zoh max RSS was 334 MiB -- try reducing runtime_constraints to "min_ram_mb_per_node":972
diff --git a/tools/crunchstat-summary/tests/logfile_20151210063411.txt.gz.report b/tools/crunchstat-summary/tests/logfile_20151210063411.txt.gz.report

index f9a34cfb98c7c6d42a633166b946b7c49db77cc1..e260ca5bdeeed232ee61e094c17fe1ccfad5063f 100644 (file)
--- a/tools/crunchstat-summary/tests/logfile_20151210063411.txt.gz.report
+++ b/tools/crunchstat-summary/tests/logfile_20151210063411.txt.gz.report
@@ -20,5 +20,4 @@ time  elapsed 2       -       4
  # Max network speed in a single interval: 0.00MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! 4xphq-8i9sb-zvb2ocfycpomrup max CPU usage was 0% -- try runtime_constraints "min_cores_per_node":1
-#!! 4xphq-8i9sb-zvb2ocfycpomrup max RSS was 1 MiB -- try runtime_constraints "min_ram_mb_per_node":972
+#!! 4xphq-8i9sb-zvb2ocfycpomrup max RSS was 1 MiB -- try reducing runtime_constraints to "min_ram_mb_per_node":972
diff --git a/tools/crunchstat-summary/tests/logfile_20151210063439.txt.gz.report b/tools/crunchstat-summary/tests/logfile_20151210063439.txt.gz.report

index c54102d78a25d1158ba563a22de7279b3d39c2f2..ffe1072250123f2b05f67ddd62da2bf0881b35a1 100644 (file)
--- a/tools/crunchstat-summary/tests/logfile_20151210063439.txt.gz.report
+++ b/tools/crunchstat-summary/tests/logfile_20151210063439.txt.gz.report
@@ -20,5 +20,4 @@ time  elapsed 2       -       3
  # Max network speed in a single interval: 0.00MB/s
  # Keep cache miss rate 0.00%
  # Keep cache utilization 0.00%
-#!! 4xphq-8i9sb-v831jm2uq0g2g9x max CPU usage was 0% -- try runtime_constraints "min_cores_per_node":1
-#!! 4xphq-8i9sb-v831jm2uq0g2g9x max RSS was 1 MiB -- try runtime_constraints "min_ram_mb_per_node":972
+#!! 4xphq-8i9sb-v831jm2uq0g2g9x max RSS was 1 MiB -- try reducing runtime_constraints to "min_ram_mb_per_node":972
author	Tom Morris <tfmorris@veritasgenetics.com>
	Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)
committer	Tom Morris <tfmorris@veritasgenetics.com>
	Thu, 21 Mar 2019 20:02:20 +0000 (16:02 -0400)
tools/crunchstat-summary/crunchstat_summary/summarizer.py		patch \| blob \| history
tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-arv-mount.txt.gz.report		patch \| blob \| history
tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk-crunchstat.txt.gz.report		patch \| blob \| history
tools/crunchstat-summary/tests/container_9tee4-dz642-lymtndkpy39eibk.txt.gz.report		patch \| blob \| history
tools/crunchstat-summary/tests/logfile_20151204190335.txt.gz.report		patch \| blob \| history
tools/crunchstat-summary/tests/logfile_20151210063411.txt.gz.report		patch \| blob \| history
tools/crunchstat-summary/tests/logfile_20151210063439.txt.gz.report		patch \| blob \| history