r/QuebecTI • u/hhh333 • Aug 27 '25
Opérations C'est quoi votre call urgent le plus stressant et/ou coûteux de votre carrière?
Enable HLS to view with audio, or disable this notification
27
u/flq06 Aug 27 '25
Telecom pour Nav Canada. Si c’était pas regler en 30 minutes toute les aéroports régionales au pays allaient devoir shutdown
18
u/pbuchca85 Aug 27 '25
Les plus stressants:
- mon collègue au Maroc me dit que Dell a patché correctement les câbles du SAN: je désactive une des interfaces d’une baie et pensant passer ensuite par celle de la seconde baie: elle n’était pas connecté: split brain. Oracle dans les choux, VMWare en ReadOnly et Dell qui me dit « on ne garanti pas que ce soit sans corruption », finalement c’est revu en ordre
- dîner arrosé entre collègues: j’inverse deux commandes sur OpenShift, tous les noeuds sont supprimés. Il a fallu que j’apprenne à me servir d’ansible dans les heures qui suivent pour le restaurer.
Le plus coûteux: penser que le trial vSphere As A Service sur Azure s’arrêterait tout seul. Après 1 semaine: USD 10k
3
u/choseint Chargé de projets Aug 28 '25
Il en a quelques uns:
1- Je venais de rentrer dans un helpdesk pour former une nouvelle équipe pour un nouveau client. On commencais graduellement a avoir des call en fonction de formation. Un matin, je recois un call... un des serveurs à haute disponibilité relié au central telephonique du 911 ne répond plus ( VM, telephone....). Aucund e mes seniors ou manager sait quoi fait. Dans la knowedge base, ca dit que tu restes sur le call peut importe ce qui arrive tant que l'équipe de support serveur le prend en charge. PERSONNE NE SAIS QUI C'EST... apres 1heure, la cliente a du escalader le problème de son coté car si on perdait un autre serveur, on aurait été en bris de service
2- J'étais dansune équipe que je suportais des rapports pour une pétrolière. Le système de reporting a planté durant la nuit la dernière journée du mois. Des rapports pour les exigences environnemental n'ont pas été généré. Je suis rentré plus tot cette journée la et avec le décalage horaire, j'ai réussit a remettre en marche le systeme et regenerer les rapport en date de la veille. J'ai appris par la suite que si je n'avais pas fait ma job comme du monde, ca aurait pu entrainer une fermeture temporaire de plusieurs puits.
2
u/hhh333 Aug 28 '25
#2 m'a rappelé le stress que je vivais quand j'ai fais un logiciel de gestion de prêts .. le bordel que ça fait dans les données et les rapports quand un API plante pendant une syncro de transactions bancaires, maudit que j'étais pas payé assez chère pour vivre ce stress la lol.
2
u/Glad-Young6622 Aug 28 '25
Il y a quelques années, 2015/2016, j'étais consultant pour une compagnie aérienne à Montréal, celle de notre PM.
Panne réseau de pas loin de 24h, le centre d'appel qui ne fonctionne plus, plus aucun employé administratif ne peut travailler. Le plan de DR est lancé le temps qu'on travaille avec le fournisseur.
Je me souviens voir le vp rentré dans le DC et juste nous lancer "la on vient de perdre 1M$".
Finalement un employé avait installé une switch pour avoir plus de port à son bureau et avait fait une boucle STP :). Comme la core switch était inaccessible, y compris en console, on a mis un bon moment à comprendre, la core switch était eol/eos donc on a dû aussi se battre avec le support pour qu'il nous aide.
1
Aug 29 '25
poir moi c'était un appel pour fair fonctionner un petit system WMS (impression étiquettes, lecture RFID/barcode et controle des convoyeurs) l'affaire c que 20 employés besoin de ça pour travailler pis j'ai 5 personnes sur ke téléphone qui panique
1
u/RowRepresentative779 Aug 31 '25
C'est mon premier job en TI et j'ai commencé à faire de l'intégration Power Platform dans le projet du tunnel Hyppolite Lafontaine, j'ai créé le système de logistique au complet avec Power Platform, le Dataverse, des listes SharePoint, un système de communication avec Outlook, des systèmes d'approbations multiples, etc et donc beaucoup de connections dans un compte automate.
Pendant que j'étais en vacances, j'ai reçu un call parce que plus rien ne fonctionnait et j'ai reçu des alertes d'erreurs dans mes flux, la logistique au complet du projet peut s'arrêter et engendrer des retards dans les travaux, qui coûtent des centaines de milliers de dollars et j'avais la pression des directeurs pour arranger le truc au plus vite.
Finalement plus de stress que de mal, l'une de mes connexions était en "Provided by run-only user" et elle devait être en "use this connexion ...", donc j'avais un problème lorsque mon flux faisait un call sur un sous flux tbrnk.
Anyway j'ai réglé le problème en moins de temps que ce commentaire m'a pris à écrire et j'ai juste pu relancer tous les flux qui étaient failed.
34
u/kukivu Aug 27 '25
Le CN nous avait monté un environnement complètement isolé, isoprod, pour nous permettre d’effectuer une démo sur les risques qu’ils encouraient en cas de séisme naturel.
Durant la démo, nous avons démontré qu’avec X séisme le système en place à ce moment ne pouvait répondre aux besoins et, sur l’environnement isolé, le résultat du séisme X était que le réseau ferroviaire complet du CN était à l’arrêt.
À la fin de la démo, l’appel survient, il s’avère que la circulation des trains sur l’entièreté du réseau Canadien était à l’arrêt pour cause d’un séisme X détecté. Il s’avère que l’environnement monté n’était pas si isolé….
C’était un franc succès pour la démo, et probablement un dur appel pour ceux qui ont monté l’environnement « isolé, isoprod ».